Сколько стоит ИИ в компании — четыре уровня бюджета

Искусственный интеллект

Вопрос «сколько это стоит» распадается на четыре уровня с разной ценой, сроком и судьбой данных — подписки, API-автоматизация, RAG-проект и свой сервер. Плюс аренда GPU в российском облаке и локальная модель на ноутбуке за ноль. Цены на сентябрь 2026 года.

1 мин чтения 9 сентября 2026 Алексей Борисов

Вопрос «сколько это стоит» звучит почти в каждой аудитории и почти всегда без уточнения, о каком уровне идёт речь. Один человек имеет в виду подписку для отдела, второй — базу знаний по внутренним регламентам, третий — сервер в собственной серверной, потому что служба безопасности закрыла облака. Три бюджета отличаются друг от друга в тысячу раз, и разговор буксует ровно до того момента, пока уровень не назван вслух.

Уровней четыре. У каждого своя цена, свой срок развёртывания, своя судьба данных и свой адресат внутри компании. Разложив их по этим четырём признакам, можно за один разговор понять, о чём именно спрашивает собеседник и какая цифра его ждёт.

Сразу оговорка, которая относится ко всему тексту. Все цифры ниже актуальны на сентябрь 2026 года. Тарифы российских провайдеров пересматриваются по нескольку раз в год, стоимость токенов у части моделей за последний год падала, цена железа зависит от поставки и курса. Порядок величин держится долго, конкретные значения — нет. Перед тем как нести смету руководству, каждую цифру нужно открыть на сайте поставщика и пересверить.

Сколько это стоит — четыре уровня бюджета: подписки, API, RAG, свой сервер
Четыре уровня бюджета: подписки, API-автоматизация, RAG-проект, свой сервер. Слайд из курса
Подписки API-автоматизация RAG-проект Свой сервер
Что это ГигаЧат или ЧатГПТ сотрудникам Скрипты, n8n, маршрутизация База знаний по своим документам Локальная модель в контуре
Порядок цифр 0–2 000 ₽ на человека в месяц От копеек за запрос 0,5–1 млн ₽ пилот, около 3 млн ₽ полное внедрение 2,5–3,5 млн ₽ железом
Срок Сегодня Недели 2–4 месяца 1–3 месяца
Данные У провайдера У провайдера Зависит от модели В контуре
Кому Каждому сотруднику Операционным процессам Поддержка, регламенты, юристы Требования службы безопасности, от 100 человек

Подписки — от нуля до двух тысяч рублей на человека

Самый простой уровень, и он же самый недооценённый. ГигаЧат или ЧатГПТ каждому сотруднику, от нуля до двух тысяч рублей на человека в месяц по состоянию на сентябрь 2026 года. Разворачивается сегодня. Данные уходят провайдеру.

Разброс начинается с нуля не для красоты. Бесплатные тарифы российских и китайских моделей закрывают заметную часть офисной рутины — черновик письма, разбор входящего документа, сводка по совещанию. Платить приходится за другое. За лимиты, длинное контекстное окно, загрузку файлов пачками, доступ к старшим моделям и за корпоративный договор, в котором прописан режим обработки данных.

Главная ловушка этого уровня к деньгам отношения не имеет. Первая причина нулевого эффекта от внедрения звучит одинаково в любой отрасли — купили подписки и не обучили. Деньги списываются каждый месяц, поведение сотрудников не меняется, через полгода закупку тихо закрывают с выводом «не взлетело». Стоимость обучения в смету обычно не кладут вообще, хотя именно она определяет, окупятся ли сами подписки.

Второе, что стоит сделать до раздачи доступов, — разобраться, что сотрудники будут в эти окна загружать. Классификация корпоративных данных по трём зонам разобрана отдельно в материале «Что можно и что нельзя грузить в нейросеть». Без неё подписка за две тысячи рублей превращается в канал утечки, который не виден ни в одном журнале службы безопасности.

API-автоматизация — от копеек за запрос

Следующий уровень начинается там, где человек перестаёт быть звеном процесса. Скрипты, сценарии в n8n, маршрутизация обращений, автоматическая разметка входящих документов. Модель здесь работает без чата, по API.

API проще всего объяснить через официанта в ресторане. Вы называете заказ, он уходит на кухню и приносит именно то, что просили, — вам не нужно знать, как устроена кухня. Оплата идёт за токены, а токены разумно считать человеко-часами языковой модели. По состоянию на сентябрь 2026 года один запрос действительно стоит копейки.

Именно эти копейки и обманывают при планировании бюджета. Считать нужно месячный объём, умноженный на длину контекста. Один разбор обращения в поддержку — доли рубля. Тысяча обращений в день с приложенной историей переписки и куском регламента в каждом запросе — совсем другой порядок, и увидеть его можно только в калькуляторе поставщика, подставив реальные объёмы своего процесса.

К стоимости самих токенов добавляется площадка, на которой живёт автоматизация. Облачная версия n8n стоит 24 доллара или евро в месяц и требует зарубежной оплаты. Российский хостинг решает вопрос оплаты и обходится дешевле — Бегет разворачивает n8n в одну кнопку примерно за 22 рубля в день с публичным IP и около 17 рублей без него, похожим образом работает Таймвеб. На собственном сервере в контейнере площадка не стоит ничего сверх самого сервера. Как устроены сценарии и чем агент отличается от чат-бота, разобрано в материале «Чем ИИ-агент отличается от чат-бота и как собрать своего в n8n».

Честная оговорка к этому уровню такая. Для значительной части офисных сотрудников макросы и горячие клавиши пригодятся чаще, чем n8n. Автоматизация начинается с задачи, и если задача решается макросом в Excel, платформа не нужна.

RAG-проект — от полумиллиона до трёх миллионов

Уровень, на который выходят, когда модель должна отвечать по внутренним документам компании. Регламенты, база знаний поддержки, договорная практика, инструкции для сервисных инженеров.

RAG удобно объяснять через умного библиотекаря. Сначала он находит нужный документ на полке, потом отвечает по нему, и в ответе видно, откуда взята каждая формулировка. Модель при этом не переучивается, знания лежат снаружи. Механика подробно разобрана в материале «Как научить нейросеть отвечать по документам компании».

Деньги здесь такие. Пилот на одном процессе — от 500 тысяч до миллиона рублей, полноценное внедрение — около трёх миллионов, срок 2–4 месяца. Цифры на сентябрь 2026 года и сильно зависят от объёма документов и от того, в каком они состоянии.

Про состояние документов и стоит говорить отдельно, потому что это скрытая статья расходов, съедающая до половины трудозатрат проекта. Подготовка и нарезка документов — самая недооценённая часть RAG-проекта. Регламенты лежат в пяти форматах, часть сканов не имеет текстового слоя и требует OCR, действующая редакция соседствует с двумя отменёнными, половина таблиц свёрстана картинками, а у трети документов не находится владельца, который подтвердит, что документ актуален. Эту работу невозможно отдать подрядчику целиком — разбирать, какая редакция действует, будут предметные специалисты компании, и их время в смету обычно не заложено ни деньгами, ни графиком.

Практический вывод отсюда простой. Начинать имеет смысл с пилота на одном процессе, где документы уже приведены в порядок. Такой пилот честно покажет и качество ответов, и реальную стоимость подготовки на остальном объёме.

Дообучение — статья расходов, которую просят чаще всего

Вопрос «сколько стоит обучить модель на наших данных» задают едва ли не чаще, чем вопрос про подписки. В большинстве случаев ответ на него — обучать не нужно.

Разница между дообучением и RAG проходит по тому, где живёт знание. При RAG модель остаётся нетронутой, документы подкладываются в запрос. При дообучении меняются веса модели, паттерны запекаются внутрь. Отсюда следует вещь, которая обычно и решает вопрос бюджета. Дообучение улучшает качество рассуждений в узком домене со специфичной терминологией. Знаний о вашей компании оно не добавляет — за них по-прежнему отвечает база документов.

Порядок величин виден на реальном примере. Т-Банк выпустил Т-Про на основе Квен, дообучив её более чем на 140 миллиардах токенов русскоязычных данных, и получил результат почти на уровне флагманских облачных моделей. Это ресурс уровня банка из первой десятки. Для обычной компании открытая модель среднего размера с хорошо собранным RAG даёт 80–90 % того же результата за малую долю стоимости, а дообучение оказывается оправданным примерно в одном случае из десяти.

Свой сервер — 2,5–3,5 миллиона рублей железом

Локальная модель внутри контура. Запросы не выходят наружу, коммерческая тайна остаётся на своей территории. Срок развёртывания 1–3 месяца, железо — от 2,5 до 3,5 миллионов рублей единовременно по ценам сентября 2026 года.

Расчёт, из которого берётся эта сумма, выглядит так. Открытая модель на 72 миллиарда параметров при Q4-квантизации требует около 40 ГБ видеопамяти. Конфигурация из четырёх RTX 4090 даёт 96 ГБ VRAM с запасом и держит 20–30 одновременных запросов, чего хватает примерно на сотню сотрудников. Программная часть при этом бесплатна — Олама поднимает модель одной командой, ЛМ Студио даёт графический интерфейс без командной строки, обе распространяются свободно.

Локальный ИИ в контуре организации: расчёт железа для 100 сотрудников
Расчёт железа: 4 × RTX 4090, ~40 ГБ VRAM, 2,5–3,5 млн ₽ единоразово. Слайд из курса

В цену железа не входит то, без чего сервер не станет корпоративным сервисом. Обратный прокси с аутентификацией и шифрованием внутри сети, запрет исходящего трафика для машины с моделью, VPN или выделенный VLAN для сотрудников, журналирование промтов и ответов для аудита и требований 152-ФЗ. И человек, который всё это настроит и будет обслуживать. Бесплатная лицензия у Олама и ЛМ Студио к бесплатной эксплуатации отношения не имеет.

Почему сервер не окупается на подписках

Эту оговорку стоит проговорить до того, как её задаст финансовый директор.

Отдел из двадцати человек на подписках стоит около сорока тысяч рублей в месяц — это 480 тысяч рублей в год. Против сервера за три миллиона рублей окупаемость наступает за пределами шестого года, и это без учёта администрирования, электричества и замены железа. На таком масштабе арифметика не сходится ни при каких допущениях.

На сотне сотрудников картина меняется. Двести тысяч рублей в месяц — это 2,4 миллиона в год, и формально сервер выходит в ноль за полтора года. Но к капитальным затратам добавляются администратор, обвязка, электричество и обновление железа через три-четыре года, а платный тариф на практике нужен далеко не всем ста сотрудникам. Так что даже там, где расчёт начинает сходиться, он сходится на грани.

Отсюда главный вывод этого текста. Сервер покупают ради контура. Его берут, когда служба безопасности запретила выносить данные наружу, когда отраслевое регулирование не оставляет выбора, когда речь о коммерческой тайне, цена утечки которой измеряется иначе, чем в рублях за подписку. Если задача звучит как «сэкономить на подписках», локальное развёртывание — неправильный ответ на неё. Порядок действий при внедрении в регулируемой отрасли разобран отдельно в материале «Как безопасно внедрить генеративный ИИ в банке».

Аренда сервера с GPU — промежуточный вариант

Между подпиской и собственным железом есть уровень, о котором вспоминают реже всего. Сервер с GPU можно арендовать в российском облаке. На Клауд.ру конфигурация, пригодная для реальной работы, обходится примерно в 150–200 тысяч рублей в месяц по ценам сентября 2026 года. Данные хранятся и обрабатываются в России, договор заключается с российским юридическим лицом, оплата проходит российской картой, капитальных затрат нет.

Арифметика здесь честная и не в пользу аренды на длинной дистанции. От 1,8 до 2,4 миллионов рублей в год против 2,5–3,5 миллионов единовременно означает, что со второго года владение дешевле. Аренда покупает обратимость. За два-три месяца на арендованных мощностях видно реальное число запросов, поведение открытой модели на ваших задачах и то, справляется ли выбранная конфигурация с нагрузкой в пиковые часы. Если гипотеза не подтвердилась, аренда просто прекращается, и в компании не остаётся стойки с железом на три миллиона.

Как первый шаг внедрения вариант рабочий, и в разговоре с бюджетным комитетом он часто проходит проще, чем закупка оборудования.

Уровень, который пропускают — ноутбук за ноль

Самый дешёвый уровень не попадает в презентации, потому что не выглядит как внедрение. Открытая компактная модель на обычном рабочем ноутбуке с 16–32 ГБ памяти, запущенная через бесплатные ЛМ Студио или Олама. Из моделей подходят компактные Квен, ДипСик, Лама, младшие ГигаЧаты.

БЯМ на обычном ноутбуке: LM Studio или Ollama, без абонентской платы
Ноутбук с 16–32 ГБ памяти и бесплатные LM Studio или Ollama — документы не покидают машину, абонентской платы нет. Слайд из курса

Что это даёт. Документы не покидают машину физически, поэтому вопрос об утечке снимается целиком. Работает без интернета — в самолёте, в командировке, в цеху без связи. Абонентской платы нет.

Пределы надо назвать так же прямо. До облачных флагманов такая связка не дотягивает. Черновики, суммаризация, разбор документов, переформулирование — да. Сложная аналитика, длинные рассуждения, работа с большим контекстом — нет. Скорость ответа на ноутбуке ниже облачной в разы, и это заметно с первой минуты.

Ценность этого уровня в другом. Это самый дешёвый способ проверить гипотезу «нам нужна локальная модель» до того, как просить три миллиона. Неделя работы на ноутбуке даёт понимание, какие задачи открытая модель действительно закрывает в вашем контуре, а какие — нет. Попробовать имеет смысл до похода за бюджетом.

Как выбрать уровень

Последовательность вопросов, которая экономит время на совещании, состоит из трёх пунктов.

Первый — какие данные участвуют в процессе. Если это первая зона, то есть персональные данные, банковская тайна, конструкторская документация с реальными параметрами, публичные модели отпадают сразу, и разговор идёт про контур. Если вторая или третья — подписки и API остаются на столе.

Второй — сколько людей. До полусотни сотрудников экономика уверенно держит подписки, от сотни начинает обсуждаться собственный контур.

Третий — что именно автоматизируется. Работа человека с текстом — подписки. Повторяющийся операционный процесс без человека внутри — API. Ответы по внутренним документам — RAG.

Двое граблей стоят на выходе с любого уровня. Первая — купили и не обучили. Вторая — пилот без метрик, результат которого нечем защитить перед бюджетом. Три метрики собираются без отдельного проекта — часы в неделю по самоотчёту сотрудников, скорость ответа клиенту из систем, доля документов и писем, сделанных с участием ИИ. Эффект считается как сэкономленные часы, умноженные на ставку, минус стоимость подписок и оборудования. Самоотчёты завышают экономию в полтора-два раза, поэтому дисконт закладывается сразу. Даже с дисконтом такой расчёт защищается лучше, чем формулировка «стало удобнее».

Что пересверить перед разговором с руководством

Каждая цифра в этом тексте — сентябрь 2026 года, и у каждой свой срок годности. Тарифы на подписки меняются несколько раз в год и чаще в сторону усложнения линейки. Стоимость токенов у большинства моделей снижается, поэтому расчёт полугодовой давности завышает бюджет API. Цена железа зависит от поставки и курса и может уехать на десятки процентов в обе стороны. Стоимость аренды GPU привязана к доступным в конкретный момент конфигурациям.

Порядок величин при этом стабилен и держится годами. Разница между подпиской за две тысячи рублей и сервером за три миллиона не изменится от того, что тариф подорожал на двести рублей. Именно поэтому в разговоре с руководством первым называется уровень. Сумма берётся вторым шагом, с сегодняшней страницы поставщика под уже названный уровень.