Офлайн ИИ — DortechPC × WEB RAMPAGE
Методика подбора · срез рынка август 2026

Как считаем: задачи бизнеса → модель → железо → цена

Как решается, какая нейросеть нужна клиенту, какая видеокарта её выдержит и сколько это стоит. Без угадывания: каждый шаг — формула или таблица. Продукт продаётся как полное техническое решение с программной настройкой — эта страница показывает, из чего складывается цена и конфигурация.

Шаг первый

Четыре вводных, с которых начинается любой подбор

ВводнаяЧто определяет
1. Какие задачи повторяются каждую неделю и жрут часы? Класс модели (лёгкая / средняя / тяжёлая) и какие помощники первыми. Без повторяющейся работы — продукт не нужен, честно отказываем.
2. Сколько людей и кто будет пользоваться? Параллельную нагрузку → одна карта или две. 5–10 человек на карту — нормально, чаты не одновременно печатают.
3. Где живут данные и сколько их (ГБ)? Диски, объём базы знаний, нужна ли отдельная модель-поисковик (эмбеддинги).
4. Что нельзя наружу ни при каких условиях? Режим изоляции: полностью офлайн или «онлайн по требованию» (радары, сбор баз — только с разрешения и по белому списку).
Словарь

Пять слов из мира ИИ — на пальцах

Этого достаточно, чтобы вести разговор о конфигурации и понимать, за что платите.

Параметры (миллиарды, «B») — извилины мозга
Больше извилин — умнее, но «дороже в кормлении»: ест больше памяти и думает дольше. 8–14 млрд — расторопный исполнитель, ~27 — сильный специалист, 70+ — профессор (медленный, но для сложного).
Память видеокарты (VRAM) — рабочий стол
Вся модель должна лежать на столе целиком — «положить половину на пол» нельзя. Стол мал — модель просто не запустится. Это единственный дефицитный ресурс: процессор и диски докупаются дёшево, стол — главный.
Квантование (Q4) — конспект вместо полного издания
Полное собрание сочинений сжимается в конспект вчетверо: места занимает ~0,6 ГБ на миллиард параметров, смысл сохраняется, теряется 2–5% оттенков. Для работы конспекта хватает — это стандарт локального запуска.
MoE (модель экспертов) — контора узких специалистов под одной вывеской
Звонок попадает одному эксперту (поэтому быстро), но зарплату платят всему штату (поэтому памяти надо под всех сразу). Модель «2,4 трлн параметров, 95 активных» отвечает шустро, но штат в 2,5 ТБ не влезет ни в один офисный шкаф — потому она и не наша.
Контекст — сколько страниц помещается на стол одновременно
50–200 страниц за один заход — для реальной работы хватает с запасом. А «прочитать всю базу» модель может и без стола: рядом стоит картотека (поиск по базе), и на стол кладётся только найденное.
Линейка августа 2026

Три класса под наш продукт

КлассМодели (август 2026) КартаСкорость ответаЛицензия
Лёгкий
8–14 млрд
Qwen 8–14B, Gemma 12B — проверенные прошлые поколения 16–24 ГБмгновенноApache/MIT — свободная коммерция
Средний — ДЕФОЛТ
~27 млрд
Qwen3.8-27B (релиз 14.08.2026; в 16 из 24 тестов выше Claude Opus 4.6 Max) RTX 5090 32 ГБсекундыApache 2.0 — можно всё
Тяжёлый
MoE / 70B-класс
GLM-5.2 (агентные цепочки, контекст 1M), DeepSeek-V4 (рассуждения, анализ), 70B-dense прошлых поколений 2× A6000 48 ГБсекунды — десятки секунд на больших задачахMIT / Apache

Почему дефолт — Qwen3.8-27B, а не «самая большая»: старший Qwen3.8 (2,4 трлн параметров) вышел с открытыми весами, но под кастомной лицензией (коммерция — только с разрешения Alibaba) и весит 2,5 ТБ — это не офисный сервер. 27B-версия полностью открыта (Apache 2.0), свежая и закрывает ~90% бизнес-задач: ответы по базе, КП, документы, письма. Правило: тяжёлый класс — только когда формулы показывают, что средняя не тянет задачу.

Под характер работы

Кто к каким задачам

Задача клиентаЧто берёмПочему
Ответы по документам, регламентам, переписке (RAG)Qwen3.8-27B Следование инструкциям, русский язык, ссылки на источник
КП, спецификации, договоры, презентацииQwen3.8-27B Стабильное качество длинных деловых текстов
Агентные цепочки (ночная ревизия почты → разбор → черновики → отчёт) GLM-5.2 (тяжёлый) или Qwen-дефолт (пока цепочки короткие) GLM — специализация на long-horizon агентах: доводит многошаговые задачи до конца
Глубокий анализ: сравнение 5 КП до дна, разбор сложного ТЗ, расчёты DeepSeek-V4 (тяжёлый)Reasoning-класс: думает по шагам, меньше ошибок в логике
Быстрые вопросы новичков, внутренний FAQЛёгкая 8–14B (вторая модель на том же сервере) Мгновенно, не занимает дефолт-модель

Ключ продажи «полного технического решения с программной настройкой»: модели — это файлы. Вторая модель на тот же сервер — дни работы, а не покупка железа. Модель 2027 года встанет на сервер 2026-го программно, без новых карт: система дорожает сама.

Сердце методики

Формулы расчёта

VRAM модели (Q4) ≈ 0,6 ГБ × млрд параметров  +  15–25% контекст  +  2–3 ГБ эмбеддинги/движок
Экономия в месяц = сэкономленные часы × частота задачи × стоимость часа специалиста
Окупаемость (мес) = чек решения ÷ экономия в месяц

Те же формулы на кухонном языке

Первая: «сколько места на столе надо» = конспект модели (27 млрд × 0,6 ≈ 16 ГБ) + место, чтобы разложить страницы с вопросом (+15–25%) + стакан с ручками для картотеки (2–3 ГБ). Итого ≈ 20 ГБ — берём стол 32 ГБ, чтобы не толкаться локтями. Вторая: три множителя — сколько часов в месяц съедает рутина × сколько стоит час человека. Третья: сколько месяцев машина будет отрабатывать свой ценник.

ПроверкаПравило
Карта под модель Правило свободной трети: треть стола должна остаться пустой (запас ×1,3). Модель, лёгшая «ровно-ровно», будет ронять страницы. Qwen3.8-27B: 16,2 + контекст ≈ 19–21 ГБ → стол 32 ГБ комфортно, 24 ГБ — впритык, не берём
Пользователи до 5–10 активных на одну карту; больше — вторая карта или облегчённая вторая модель под простые вопросы
Обвязка RAM = 2 × VRAM; NVMe 2×2 ТБ; ИБП по мощности карт (5090 — 575 Вт, это кладовка/серверная, не стол секретарю); CPU 8 ядер достаточно
Экономика Считаем ДО покупки на 3–5 задачах клиента. Окупаемость до ~18 мес на одной задаче / 4–8 мес на пакете задач — берёмся. Дольше или нет задач — не ставим
Учебный пример

Полный прогон: торговая компания B2B, 20 человек

Дистрибуция промышленной автоматики. Пример учебный — на первой встрече считаем так же на ваших цифрах.

Вводные: менеджер делает КП 4 часа × 30 шт/мес; входящие письма — 50/день, на разбор каждого 15 минут; перед звонками копаются в почте по истории клиента 20 минут × 10 звонков/день. Час менеджера ≈ 800 ₽. 6 человек будут пользоваться. Данные — почта + папки с КП на общем диске, ~40 ГБ. Наружу нельзя — клиентские цены.

Шаг 1. Задачи → экономия (формула):
КП: 4ч → 45 мин = 3,25ч × 30 × 800 = 78 000 ₽/мес
Письма: 15 мин → 3 мин = 0,2ч × 50 × 21 день × 800 = 168 000 ₽/мес
История клиента перед звонком: 20 мин → 1 мин = 0,32ч × 10 × 21 × 800 = 53 700 ₽/мес
Итого ≈ 300 000 ₽/мес (консервативно берём 250–300).

Шаг 2. Класс модели: все три задачи — текстовые, RAG + генерация → средний класс, Qwen3.8-27B. Тяжёлая не нужна: нет многочасовых цепочек и глубокой аналитики.

Шаг 3. Железо: VRAM ≈ 21 ГБ → RTX 5090 32 ГБ; 6 пользователей — одна карта ок; RAM 64 ГБ, 2×2 ТБ NVMe, ИБП.

Шаг 4. Чек: по матрице — сценарий «Компания», ≈ 1,2–1,5 млн под ключ (сервер + настройка + обучение одним договором).

Шаг 5. Окупаемость: 1 350 000 ÷ 300 000 ≈ 4,5 месяца. Продажа честная, берёмся. (Даже по одной задаче КП: 1,35 млн ÷ 78 тыс ≈ 17 мес — на грани, но пакет вытягивает с запасом.)

Типовые конфигурации

Выборка по нишам: кому что подходит

Стартовые гипотезы по сегментам. Финальный расчёт всегда по вводным конкретного клиента.

Малый офис: оптовик, агентство, практика (5–15 чел)

  • Задачи: КП и ответы клиентам (директор делает сам вечером), внутренний FAQ, история клиентов
  • Конфигурация: лёгкая 8–14B или сразу Qwen3.8-27B «на вырост»; одна карта 24–32 ГБ; 1–5 пользователей
  • Ориентир чека: 0,65–1,0 млн

Нюанс ниши: решает цена входа. Если бюджет зажат — лёгкая модель сейчас, программный апгрейд до 27B через полгода без нового железа. Экономика: 2–3 задачи × 30–60 тыс/мес экономии → окупаемость 12–18 мес — на грани, фильтр честности работает жёстче всего здесь.

Торговая компания / дистрибуция B2B (15–60 чел)

  • Задачи: КП, входящая почта, досье клиентов, сравнение КП поставщиков, реанимация спящей базы
  • Конфигурация: дефолт: Qwen3.8-27B на RTX 5090 32 ГБ; 5–15 пользователей
  • Ориентир чека: 1,2–1,9 млн

Нюанс: экономика самая чистая — продажи и письма считаются в рублях легко (см. учебный расчёт выше). Основной сегмент.

Производство / завод (100+ чел, несколько отделов)

  • Задачи: ПТО: опросные листы, нормоконтроль, паспорта изделий. Снабжение: контрагенты, трендер заказов. Продажи: тендерные досье. Финансы: акты, дебиторка
  • Конфигурация: тяжёлый класс: GLM-5.2 на конвейеры + DeepSeek-V4 на аналитику, 2× A6000 48 ГБ; лёгкая модель днём на быстрые вопросы
  • Ориентир чека: 2,3–3,5 млн

Нюанс: главный актив — экспертиза ветеранов. Интервью-хранилищу тяжёлая модель не обязательна, а вот нормоконтроль под новые ГОСТ и разбор сложных ТЗ — задача reasoning-класса. Здесь двухмодельная схема окупается быстрее всего.

Юристы, бухгалтерии, аудиторские практики (5–30 чел)

  • Задачи: черновики документов по шаблонам фирмы, ответы на типовые вопросы клиентов, поиск по практике фирмы
  • Конфигурация: Qwen3.8-27B, одна карта; режим строго офлайн — у них чужие персональные данные по определению профессии
  • Ориентир чека: 0,9–1,3 млн

Нюанс: 152-ФЗ и профэтика — продаём именно изоляцию: ни байта наружу, онлайн выключен физически. Их страх — наш главный аргумент.

Медицина: клиники, лаборатории (15–50 чел)

  • Задачи: ответы по регламентам и протоколам, постпродажный FAQ пациентам, документооборот направлений
  • Конфигурация: Qwen3.8-27B, одна карта, строгий офлайн; отдельная песочница для обезличенных данных
  • Ориентир чека: 1,0–1,5 млн

Нюанс: врачебные данные = особая категория персональных данных. Локальность — не преимущество, а единственный законный способ вообще иметь ИИ-помощника с такими данными.

Стройподряд / EPC (30–100 чел)

  • Задачи: КС-2/КС-3 конвейер, претензии, входящие ТЗ, тендерные пакеты, дебиторка
  • Конфигурация: Qwen3.8-27B + тяжёлая на аналитику договоров; 1–2 карты 48 ГБ
  • Ориентир чека: 1,6–2,4 млн

Нюанс: цикл денег длинный (112 дней задержек) — экономию показываем не на «часах менеджера», а на «днях закрытия актов»: конвейер КС-ок возвращает оплату на 30–60 дней раньше. Час × ставка здесь не главное — дни × сумма кредита.

Как не надо

Анти-паттерны: как НЕ подбирают

  • «Возьмём самую большую — на вырост». Переплата за молчание: тяжёлая модель на задачах средней сложности даёт то же качество втрое дороже по железу.
  • Одна тяжёлая на всё. Быстрые вопросы будут ждать десятки секунд — люди бросают привычку за неделю. Правильно: дефолт средняя + лёгкая на простое.
  • Карта впритык. Модель влезла «ровно-ровно» = контекст не влез, длинные документы режутся. Запас ×1,3 обязателен.
  • Забыть питание и место. 575 Вт под столом — это отключения и пыль. Сразу закладываем ИБП и место в серверной/кладовке.
  • Считать окупаемость после покупки. Только до: нет задач с экономией — нет проекта. «Не окупается — не поставим» — это правило методики, не слоган.
Рынок

Где смотреть цены на железо

Цены плавают с курсом — в клиентские документы идут со свежего среза, максимум неделя. Модели бесплатны (открытые веса), платите за железо и настройку.

ЧтоГде смотреть
Видеокарты (потребительские 5090/4090) DNS, Regard, Citilink — розница; параллельный импорт — Авито/серверные интеграторы
Проф-карты (A6000 48 ГБ)Serverflow, НАГ (shop.nag.ru), BORN — интеграторы серверного железа
Готовые GPU-серверыMDM Electronics, HyperPC, Digital Razor
Обзоры и вилки сборокHabr (статьи про сборку под локальный ИИ), r/LocalLLaMA
Аренда GPU (демо-стенд, пилот 1–2 мес) QuData, immers.cloud, Selectel, HOSTKEY — от ~35–60 тыс ₽/мес за карту 24–32 ГБ

Ориентиры августа 2026: RTX 5090 32 ГБ ≈ 320–350 тыс; A6000 48 ГБ ≈ 570–700 тыс; готовый сервер 2×4090 ≈ 1,4 млн.

Сухой остаток

Памятка одним абзацем

Задачи клиента → экономия формулой (нет экономии — нет проекта) → класс модели под характер задач (текст = Qwen3.8-27B, конвейеры = GLM, анализ = DeepSeek) → VRAM = 0,6 ГБ × млрд параметров + 25% → карта ×1,3 запасом → пользователи ≤ 10 на карту → чек из матрицы → окупаемость до покупки. Всё остальное — программная настройка: модели меняются файлами, сервер живёт годами.

Актуальность моделей: срез августа 2026 (Qwen3.8-27B Apache 2.0; GLM-5.2 MIT; DeepSeek-V4 MIT). Перед сделкой — проверка свежих релизов: за квартал ландшафт меняется.

Дальше

Как эти слои работают внутри системы — «Как устроено».
Что это даёт бизнесу и сколько стоит — «Продукт».

Расчёт под вас

Хотите такой же расчёт на своих цифрах — бесплатно и без обязательств.