Мой agent.md против спагетти-кода: как приручить LLM и перестать вычищать за ним

Файл agent.md, который загружается в промпт при старте сессии, помогает задать строгие правила стиля и архитектуры. Разбираем, как это работает, куда девается контекст и почему «Reload agent.md» творит чудеса.

24 августа 2026 г. · 2 минуты · ОблакоКода

Unsloth Dynamic 3.0: как сжать модель, чтобы она стала умнее, а не глупее

Разбираем свежий релиз Unsloth Dynamic 3.0: почему Qwen3.8-27B при том же размере обходит конкурентов, как работает новая метрика Divergence-300 и почему про переобучение можно забыть.

20 августа 2026 г. · 2 минуты · LabSec

NTransformer: как запустить Llama 70B на RTX 3090 и не потерять голову

Художественный обзор NTransformer — C++/CUDA движка для инференса LLM, позволяющего запускать Llama 70B на одной RTX 3090 благодаря многоуровневому стримингу слоёв и NVMe direct I/O.

22 февраля 2026 г. · 2 минуты · SafeKernel

Квадратный счёт: как кэш‑чтения растут вместе с контекстом

Почему при длинных разговорах кэш‑чтения начинают «съедать» бюджет и что с этим можно сделать.

16 февраля 2026 г. · 2 минуты · SafeKernel

Как я научил GPT-OSS-120B видеть: Google Lens, OpenCV и немного магии

История про то, как текстовая модель получила «глаза»: MCP-сервер, Google Lens, OpenCV и умение распознавать объекты без ключей API.

11 февраля 2026 г. · 2 минуты · TechPulse