Как решается, какая нейросеть нужна клиенту, какая видеокарта её выдержит и сколько это стоит. Без угадывания: каждый шаг — формула или таблица. Продукт продаётся как полное техническое решение с программной настройкой — эта страница показывает, из чего складывается цена и конфигурация.
| Вводная | Что определяет |
|---|---|
| 1. Какие задачи повторяются каждую неделю и жрут часы? | Класс модели (лёгкая / средняя / тяжёлая) и какие помощники первыми. Без повторяющейся работы — продукт не нужен, честно отказываем. |
| 2. Сколько людей и кто будет пользоваться? | Параллельную нагрузку → одна карта или две. 5–10 человек на карту — нормально, чаты не одновременно печатают. |
| 3. Где живут данные и сколько их (ГБ)? | Диски, объём базы знаний, нужна ли отдельная модель-поисковик (эмбеддинги). |
| 4. Что нельзя наружу ни при каких условиях? | Режим изоляции: полностью офлайн или «онлайн по требованию» (радары, сбор баз — только с разрешения и по белому списку). |
Этого достаточно, чтобы вести разговор о конфигурации и понимать, за что платите.
| Класс | Модели (август 2026) | Карта | Скорость ответа | Лицензия |
|---|---|---|---|---|
| Лёгкий 8–14 млрд |
Qwen 8–14B, Gemma 12B — проверенные прошлые поколения | 16–24 ГБ | мгновенно | Apache/MIT — свободная коммерция |
| Средний — ДЕФОЛТ ~27 млрд |
Qwen3.8-27B (релиз 14.08.2026; в 16 из 24 тестов выше Claude Opus 4.6 Max) | RTX 5090 32 ГБ | секунды | Apache 2.0 — можно всё |
| Тяжёлый MoE / 70B-класс |
GLM-5.2 (агентные цепочки, контекст 1M), DeepSeek-V4 (рассуждения, анализ), 70B-dense прошлых поколений | 2× A6000 48 ГБ | секунды — десятки секунд на больших задачах | MIT / Apache |
Почему дефолт — Qwen3.8-27B, а не «самая большая»: старший Qwen3.8 (2,4 трлн параметров) вышел с открытыми весами, но под кастомной лицензией (коммерция — только с разрешения Alibaba) и весит 2,5 ТБ — это не офисный сервер. 27B-версия полностью открыта (Apache 2.0), свежая и закрывает ~90% бизнес-задач: ответы по базе, КП, документы, письма. Правило: тяжёлый класс — только когда формулы показывают, что средняя не тянет задачу.
| Задача клиента | Что берём | Почему |
|---|---|---|
| Ответы по документам, регламентам, переписке (RAG) | Qwen3.8-27B | Следование инструкциям, русский язык, ссылки на источник |
| КП, спецификации, договоры, презентации | Qwen3.8-27B | Стабильное качество длинных деловых текстов |
| Агентные цепочки (ночная ревизия почты → разбор → черновики → отчёт) | GLM-5.2 (тяжёлый) или Qwen-дефолт (пока цепочки короткие) | GLM — специализация на long-horizon агентах: доводит многошаговые задачи до конца |
| Глубокий анализ: сравнение 5 КП до дна, разбор сложного ТЗ, расчёты | DeepSeek-V4 (тяжёлый) | Reasoning-класс: думает по шагам, меньше ошибок в логике |
| Быстрые вопросы новичков, внутренний FAQ | Лёгкая 8–14B (вторая модель на том же сервере) | Мгновенно, не занимает дефолт-модель |
Ключ продажи «полного технического решения с программной настройкой»: модели — это файлы. Вторая модель на тот же сервер — дни работы, а не покупка железа. Модель 2027 года встанет на сервер 2026-го программно, без новых карт: система дорожает сама.
Первая: «сколько места на столе надо» = конспект модели (27 млрд × 0,6 ≈ 16 ГБ) + место, чтобы разложить страницы с вопросом (+15–25%) + стакан с ручками для картотеки (2–3 ГБ). Итого ≈ 20 ГБ — берём стол 32 ГБ, чтобы не толкаться локтями. Вторая: три множителя — сколько часов в месяц съедает рутина × сколько стоит час человека. Третья: сколько месяцев машина будет отрабатывать свой ценник.
| Проверка | Правило |
|---|---|
| Карта под модель | Правило свободной трети: треть стола должна остаться пустой (запас ×1,3). Модель, лёгшая «ровно-ровно», будет ронять страницы. Qwen3.8-27B: 16,2 + контекст ≈ 19–21 ГБ → стол 32 ГБ комфортно, 24 ГБ — впритык, не берём |
| Пользователи | до 5–10 активных на одну карту; больше — вторая карта или облегчённая вторая модель под простые вопросы |
| Обвязка | RAM = 2 × VRAM; NVMe 2×2 ТБ; ИБП по мощности карт (5090 — 575 Вт, это кладовка/серверная, не стол секретарю); CPU 8 ядер достаточно |
| Экономика | Считаем ДО покупки на 3–5 задачах клиента. Окупаемость до ~18 мес на одной задаче / 4–8 мес на пакете задач — берёмся. Дольше или нет задач — не ставим |
Дистрибуция промышленной автоматики. Пример учебный — на первой встрече считаем так же на ваших цифрах.
Вводные: менеджер делает КП 4 часа × 30 шт/мес; входящие письма — 50/день, на разбор каждого 15 минут; перед звонками копаются в почте по истории клиента 20 минут × 10 звонков/день. Час менеджера ≈ 800 ₽. 6 человек будут пользоваться. Данные — почта + папки с КП на общем диске, ~40 ГБ. Наружу нельзя — клиентские цены.
Шаг 1. Задачи → экономия (формула):
КП: 4ч → 45 мин = 3,25ч × 30 × 800 = 78 000 ₽/мес
Письма: 15 мин → 3 мин = 0,2ч × 50 × 21 день × 800 = 168 000 ₽/мес
История клиента перед звонком: 20 мин → 1 мин = 0,32ч × 10 × 21 × 800 = 53 700 ₽/мес
Итого ≈ 300 000 ₽/мес (консервативно берём 250–300).
Шаг 2. Класс модели: все три задачи — текстовые, RAG + генерация → средний класс, Qwen3.8-27B. Тяжёлая не нужна: нет многочасовых цепочек и глубокой аналитики.
Шаг 3. Железо: VRAM ≈ 21 ГБ → RTX 5090 32 ГБ; 6 пользователей — одна карта ок; RAM 64 ГБ, 2×2 ТБ NVMe, ИБП.
Шаг 4. Чек: по матрице — сценарий «Компания», ≈ 1,2–1,5 млн под ключ (сервер + настройка + обучение одним договором).
Шаг 5. Окупаемость: 1 350 000 ÷ 300 000 ≈ 4,5 месяца. Продажа честная, берёмся. (Даже по одной задаче КП: 1,35 млн ÷ 78 тыс ≈ 17 мес — на грани, но пакет вытягивает с запасом.)
Стартовые гипотезы по сегментам. Финальный расчёт всегда по вводным конкретного клиента.
Нюанс ниши: решает цена входа. Если бюджет зажат — лёгкая модель сейчас, программный апгрейд до 27B через полгода без нового железа. Экономика: 2–3 задачи × 30–60 тыс/мес экономии → окупаемость 12–18 мес — на грани, фильтр честности работает жёстче всего здесь.
Нюанс: экономика самая чистая — продажи и письма считаются в рублях легко (см. учебный расчёт выше). Основной сегмент.
Нюанс: главный актив — экспертиза ветеранов. Интервью-хранилищу тяжёлая модель не обязательна, а вот нормоконтроль под новые ГОСТ и разбор сложных ТЗ — задача reasoning-класса. Здесь двухмодельная схема окупается быстрее всего.
Нюанс: 152-ФЗ и профэтика — продаём именно изоляцию: ни байта наружу, онлайн выключен физически. Их страх — наш главный аргумент.
Нюанс: врачебные данные = особая категория персональных данных. Локальность — не преимущество, а единственный законный способ вообще иметь ИИ-помощника с такими данными.
Нюанс: цикл денег длинный (112 дней задержек) — экономию показываем не на «часах менеджера», а на «днях закрытия актов»: конвейер КС-ок возвращает оплату на 30–60 дней раньше. Час × ставка здесь не главное — дни × сумма кредита.
Цены плавают с курсом — в клиентские документы идут со свежего среза, максимум неделя. Модели бесплатны (открытые веса), платите за железо и настройку.
| Что | Где смотреть |
|---|---|
| Видеокарты (потребительские 5090/4090) | DNS, Regard, Citilink — розница; параллельный импорт — Авито/серверные интеграторы |
| Проф-карты (A6000 48 ГБ) | Serverflow, НАГ (shop.nag.ru), BORN — интеграторы серверного железа |
| Готовые GPU-серверы | MDM Electronics, HyperPC, Digital Razor |
| Обзоры и вилки сборок | Habr (статьи про сборку под локальный ИИ), r/LocalLLaMA |
| Аренда GPU (демо-стенд, пилот 1–2 мес) | QuData, immers.cloud, Selectel, HOSTKEY — от ~35–60 тыс ₽/мес за карту 24–32 ГБ |
Ориентиры августа 2026: RTX 5090 32 ГБ ≈ 320–350 тыс; A6000 48 ГБ ≈ 570–700 тыс; готовый сервер 2×4090 ≈ 1,4 млн.
Задачи клиента → экономия формулой (нет экономии — нет проекта) → класс модели под характер задач (текст = Qwen3.8-27B, конвейеры = GLM, анализ = DeepSeek) → VRAM = 0,6 ГБ × млрд параметров + 25% → карта ×1,3 запасом → пользователи ≤ 10 на карту → чек из матрицы → окупаемость до покупки. Всё остальное — программная настройка: модели меняются файлами, сервер живёт годами.
Актуальность моделей: срез августа 2026 (Qwen3.8-27B Apache 2.0; GLM-5.2 MIT; DeepSeek-V4 MIT). Перед сделкой — проверка свежих релизов: за квартал ландшафт меняется.
Как эти слои работают внутри системы —
«Как устроено».
Что это даёт бизнесу и сколько стоит —
«Продукт».
Хотите такой же расчёт на своих цифрах — бесплатно и без обязательств.