Как ИИ‑ядра Metal ускорили PyTorch на устройствах Apple на 87%

Команда исследователей проверила, смогут ли фронтир‑модели сами писать оптимизированные Metal‑ядра для PyTorch — и смогли: средний прирост 1.87× по 215 модулям, местами — сотни раз. Лучшие результаты даёт «рой» агентов с принципом Best‑of‑N и контекстом из CUDA‑кода и профилинга.

сентября 3, 2025 · 2 минуты · SafeKernel