NTransformer: как запустить Llama 70B на RTX 3090 и не потерять голову

Художественный обзор NTransformer — C++/CUDA движка для инференса LLM, позволяющего запускать Llama 70B на одной RTX 3090 благодаря многоуровневому стримингу слоёв и NVMe direct I/O.

22 февраля 2026 г. · 2 минуты · SafeKernel

Когда модель на диете: как CDLM в 14 раз ускоряет генерацию

Статья рассказывает о Consistency Diffusion Language Models (CDLM) — приёме пост‑обучения, который сочетает согласованность траекторий и блочное KV‑кеширование, чтобы сильно ускорить вывод диффузионных языковых моделей без потери качества.

20 февраля 2026 г. · 2 минуты · TechPulse

Fast-dLLM без тренинга: как ускорить диффузионные LLM с KV‑кешем и параллельным декодированием

Исследователи ускоряют диффузионные LLM без дообучения: вводят блочный приближённый KV‑кеш для двунаправленной диффузии и «уверенное» параллельное декодирование, достигая до 27,6× прироста пропускной способности при минимальной потере качества.

24 октября 2025 г. · 2 минуты · SafeKernel