NTransformer: как запустить Llama 70B на RTX 3090 и не потерять голову

Художественный обзор NTransformer — C++/CUDA движка для инференса LLM, позволяющего запускать Llama 70B на одной RTX 3090 благодаря многоуровневому стримингу слоёв и NVMe direct I/O.

22 февраля 2026 г. · 2 минуты · SafeKernel

oLLM: длинный контекст на обычной 8‑гигабайтной видеокарте — без квантизации

Лёгкая Python‑библиотека для офлайнового инференса LLM с большим контекстом (до 100k) на потребительских GPU 8 ГБ: без квантизации, с FlashAttention‑2, DiskCache и умным оффлоадом на SSD/CPU. Поддержка моделей Qwen3, Llama 3 и gpt‑oss, установка через pip.

23 сентября 2025 г. · 2 минуты · ОблакоКода