Половина PR, прошедших SWE‑bench, не попала бы в main — и это важно

Исследование METR показывает, что многие патчи, которые проходят автоматические тесты, отклоняются реальными мейнтейнерами: простой автоматический градер переоценивает полезность агентов.

12 марта 2026 г. · 2 минуты · TechPulse

Как спросить у трёх миллиардов векторов и не сойти с ума

Эксперименты с поиском по векторам: от наивной реализации к векторизации NumPy, проблеме OOM и идеям масштабирования вроде батчинга, mmap и map‑reduce.

7 марта 2026 г. · 2 минуты · TechPulse

Когда ИИ обгоняет профессионала: GPT-5.4 берёт 83% рынка у привычных навыков

Лёгкий и образный рассказ о том, как OpenAI представила GPT-5.4 — модель, которая в тестах опережает людей в профессиональных задачах 83% времени, становится надёжнее и получает новые способности.

6 марта 2026 г. · 2 минуты · SafeKernel

Как я учил Gemini рисовать скетчноуты: Nano Banana 2 в деле

Лёгкий и живой отчёт о том, как Nano Banana 2 (Gemini) учится делать скетчноуты: победы, смешные провалы и пять практических советов.

5 марта 2026 г. · 2 минуты · TechPulse

Кекура: симуляция, которая не даст вашему голосовому агенту пройти мимо родных данных

Cekura (YC F24) предлагает симуляции «синтетических пользователей», Mock-инструменты и оценку полноты сессий — чтобы баги агентов не проскальзывали между репликами.

4 марта 2026 г. · 2 минуты · НейроКод