Протокол совещания за десять рублей

Искусственный интеллект · Нейросети

Распознавание речи решено давно, решено российскими компаниями и работает без VPN. Час записи стоит около десяти рублей у Яндекс СпичКита, дороже и проще у СалютСпича, бесплатно и локально у ГигаАМ. Полная цепочка от записи до готового протокола, кейс с массивом собеседований и граница по персональным данным.

1 мин чтения 9 сентября 2026 Алексей Борисов

Записи совещаний есть почти в каждой организации. Диктофон в телефоне на планёрке, встроенная запись в сервисе видеосвязи, запись звонков в телефонии, видео с собеседования. Файлы складываются в папку и там остаются. Полностью их не слушает никто, включая того, кто нажимал кнопку записи.

Час такой записи превращается в текст примерно за десять рублей. Из всего, что я показываю на курсах, распознавание речи — самое незаслуженно забытое направление. Задача решена давно и решена хорошо, решена российскими компаниями, работает без VPN и без зарубежных карт. И внедряется она реже всего остального.

Почему это направление пропускают

Распознавание речи не выглядит новинкой. Оно не даёт эффектной картинки для презентации на правлении и не производит впечатления на демонстрации — текст на экране просто появляется, и всё. Генерация изображений и чат-боты забирают внимание целиком, хотя приносят бизнесу заметно меньше.

При этом речь есть практически в любой деятельности. Планёрки, переговоры с подрядчиками, звонки клиентов, собеседования, обучение, приёмка работ, комиссии, интервью с экспертами внутри компании. Всё это уже говорится вслух, и значительная часть уже записывается — по регламенту, по привычке или на всякий случай.

В моей выборке из тридцати пяти нормализованных лекций тема распознавания речи возникает в тридцати. Показательна здесь форма вопросов. Спрашивают механику. «Это ставится на компьютер? Когда идёт совещание, я включаю, нажимаю кнопочку, и он слушает, а потом?» Такой вопрос задаёт человек, который уже решил делать и уточняет последовательность действий. Для сравнения, про генерацию картинок чаще спрашивают, законно ли это и не заменит ли оно дизайнера.

Отвечаю на механику сразу. Есть два пути. Файл с записи отдаётся сервису распознавания после встречи, и это основной сценарий, который дальше разбираю подробно. Либо протокол собирает сам сервис видеосвязи прямо во время звонка — про этот вариант отдельный раздел ниже.

Цепочка из четырёх шагов

Полный путь от звука до документа выглядит одинаково почти в любой задаче. Запись, расшифровка, обработка языковой моделью, готовый результат. Шаги стоит держать раздельно, потому что ломаются они по-разному и стоят тоже по-разному.

Запись. Здесь обычно ничего внедрять не нужно, потому что записи уже есть. Диктофон в телефоне даёт приемлемое качество для переговорки на шесть человек, если положить его в середину стола. Сервисы видеосвязи пишут звонок штатно. Телефония в связке с CRM хранит разговоры месяцами и часто годами. Единственное, что действительно стоит поправить на этом шаге, — микрофон в переговорной комнате, потому что дальше по цепочке качество звука определяет всё.

Расшифровка. Сервис распознавания превращает звук в текст. В интерфейсе Яндекс СпичКита загруженный файл сопровождается двумя переключателями, которые решают, что вы получите на выходе. Нормализация отвечает за заглавные буквы и знаки препинания. Определение дикторов раскладывает реплики по говорящим.

Без нормализации текст приходит сплошным полотном. Ни заглавных букв, ни точек, ни абзацев, зато дословно — со всеми «эээ», «ну вот», обрывами фраз и повторами. Выглядит это пугающе, и именно в таком виде текст наиболее ценен как первоисточник. К нему возвращаются, когда через месяц возникает спор, кто что пообещал.

Обработка языковой моделью. Здесь из полотна появляется документ. Сырая транскрибация и нормализация — две разные задачи с разными применениями, и путать их не стоит. Расшифровка отвечает за точность слов, языковая модель отвечает за форму и смысловую выжимку.

Промт, с которого имеет смысл начинать, помещается в три предложения.

Перед тобой расшифровка совещания. Восстанови пунктуацию и абзацы,
убери слова-паразиты и повторы, смысл и формулировки не меняй.
Дальше собери протокол — участники, обсуждённые вопросы, принятые
решения, поручения с ответственными и сроками. Места, где решение
прозвучало неоднозначно, вынеси отдельным перечнем спорных пунктов.

Последнее предложение в этом промте важнее первых двух. Модель охотно превращает вялое обсуждение в уверенный список решений, которых на встрече никто не принимал. Явное требование выделить спорные места возвращает эту уверенность в разумные рамки.

Расшифровка речи: сырой текст без пунктуации и структурированный текст рядом
Слева — сырая расшифровка без пунктуации и заглавных букв. Справа — тот же фрагмент после обработки языковой моделью. Слайд из курса

Результат. Протокол — только один из вариантов выхода. Из той же расшифровки собирается инструкция по процессу, черновик регламента, список вопросов для FAQ, карточка клиента, справка для того, кто на встрече не был. Что делать с готовыми протоколами дальше, чтобы они превращались в проверяемые поручения, разбирал в статье «ИИ для проектного офиса без потери контроля». Я, например, прогоняю через эту цепочку собственные лекции и потом переделываю по ним презентации — слышно, где объяснение провисло и где аудитория переспрашивала.

Сколько это стоит на самом деле

Первый уточняющий вопрос из аудитории звучит так. Десять рублей — это за час диалога или за час работы по расшифровке? За час записи. Двухчасовое совещание стоит около двадцати рублей независимо от того, сколько сервис будет его обрабатывать.

Цифра проверяемая, и проверял я её по собственному счёту. За один заход через асинхронный режим Яндекс СпичКита прошло 504 481 секунда записей, это около 140 часов. В счёте — 1282,22 рубля. Делим одно на другое и получаем 9,15 рубля за час, то есть заявленные десять рублей подтверждаются практикой. Весь этот массив лекций расшифровался за сутки.

Расчёт цены расшифровки речи: 504 481 секунда — 1282,22 рубля
504 481 секунда записей — 1282,22 рубля по счёту. Фактическая цена ≈ заявленным 10 ₽/час. Слайд из курса

Дальше начинается разница в удобстве, и она существеннее разницы в цене.

Инструмент Цена за час записи Как устроен доступ
Яндекс СпичКит около 10 ₽ в асинхронном режиме Консоль Яндекс Облака и API, отдельной программы нет
СалютСпич 200–300 ₽ Приложение для Windows, ключ и пакет минут
ГигаАМ бесплатно Локальная установка на свой сервер или ноутбук

Яндекс СпичКит дешевле всех на российском рынке и сложнее всех в работе. Простого интерфейса у него по большому счёту не существует. Регистрация в Яндекс Облаке, загрузка файлов в хранилище, получение результата оттуда же, для потока — API-ключи и настройка. Это программистская история, и если вы планируете расшифровывать регулярно, на первую настройку стоит закладывать время разработчика.

СалютСпич устроен противоположным образом. Скачиваете приложение под Windows, регистрируетесь, генерируете ключ, выбираете пакет минут, загружаете файл и смотрите, как распознавание идёт по шагам. Дороже в двадцать раз, зато сотрудник справится сам в тот же день.

Арифметика выбора простая. На двадцати часах записей разница между двумястами рублями и пятью тысячами не стоит ни одного совещания об этой разнице. На тысяче часов она уже определяет решение. Асинхронный режим означает, что результат приходит не мгновенно — вы отдаёте файл и забираете текст позже, и для накопленного архива это ровно та задержка, которой можно не замечать.

Бесплатно в облаке нельзя, локально можно

Это первое, о чём спрашивает аудитория, поэтому отвечаю прямо. В облаке расшифровывать бесплатно не получится. Пробные лимиты есть у всех сервисов, но они заканчиваются на первых часах, дальше работает счётчик. Локально бесплатно получается, и вполне рабоче.

Инструмент, который закрывает этот вопрос сегодня, — ГигаАМ. Модель распознавания речи от Сбера с открытыми весами и открытой лицензией, ставится на собственный сервер или на ноутбук, после установки интернет ей не нужен. Файл модели весит около 440 мегабайт, видеокарта не требуется, работает на обычном процессоре.

Свой опыт приведу честно, вместе с ограничением. У меня ГигаАМ работает на сервере с двумя процессорными ядрами, через него прошло больше ста лекционных записей длиной от часа до пяти. Час записи обрабатывается примерно за двадцать минут, то есть за ночь спокойно уходит рабочий день разговоров. Бесплатно здесь относится к деньгам и не относится к ресурсам. Модель держит около двух гигабайт оперативной памяти, и на моём сервере, где рядом живут сайты, её однажды сняла система за нехватку памяти. Для ноутбука это некритично, для нагруженного сервера — фактор планирования.

Виспер от ОпенЭйАй и его ускоренная реализация Фастер Виспер решают ту же задачу и тоже ставятся локально. На русском языке ГигаАМ уверенно точнее, поэтому в российском контуре я обычно рекомендую начинать с него. Ещё одна деталь, о которой спрашивают отдельно. И Яндекс СпичКит, и СалютСпич тоже разворачиваются локально в контуре организации, но это уже корпоративная поставка со своим бюджетом и сроками.

Массив собеседований, который никто не слушал

Самый интересный кейс по этой теме мне рассказали в аудитории, и он же самый неочевидный.

Компания записывала собеседования. Обычная практика — запись нужна, чтобы вернуться к разговору, если кандидатов много, а решение принимает не один человек. Записи копились и лежали мёртвым грузом, потому что после найма конкретного человека его собеседование теряет ценность.

Дальше сделали шаг в сторону. Расшифровали массив целиком и задали к нему вопрос про самих себя. Какие вопросы кандидаты задают чаще всего? В ответе оказались вполне ожидаемые пункты про деньги, график и удалёнку. Но нашлись и неочевидные повторяющиеся вопросы, которые задавали почти все и на которые в описании вакансии ответа не было. Эти пункты внесли в текст вакансий на ХедХантере. Записи при этом обрабатывались внутри организации и наружу не уходили.

Обратите внимание, что именно здесь произошло. Сменился объект анализа. Обычно одно собеседование слушают, чтобы оценить кандидата. Здесь прочитали двести, чтобы оценить собственную вакансию — и получили правку в тексте, которая экономит время рекрутера на каждом следующем звонке.

Это частный случай приёма, который я повторяю на каждом курсе. Накопленный массив разговоров — недооценённый источник данных. Он работает одинаково для звонков в колл-центр, для переговоров с подрядчиками, для обращений клиентов и для внутренних планёрок. Никто и никогда не слушает записи звонков полностью, поэтому всё, что там сказано, для организации фактически не существует. Расшифровка возвращает этот материал в оборот, а языковая модель отвечает по нему на вопросы, которые раньше задать было некому.

Вопросы к массиву формулируются обычным языком. Что клиенты спрашивают чаще всего? На каком этапе разговора чаще всего возникает возражение? Какие темы повторяются в жалобах последнего квартала? Что мы обещаем клиентам устно, чего нет в договоре? Ответы придётся проверять выборочно по исходным записям, и это нормальная часть работы.

Если вас интересует эта же логика применительно к операторам и контролю качества в банке, там свои требования и свой порядок внедрения — разбирал отдельно в статье «ИИ в банковском колл-центре — контроль качества звонков». Здесь речь про универсальный сценарий, доступный компании любого размера.

Секретарь внутри встречи

Второй путь короче. Протокол собирает сам сервис видеосвязи, и к концу звонка он уже готов. Кнопка находится в интерфейсе встречи, отдельного файла и отдельной загрузки не требуется.

В российском контуре это умеют три сервиса. СберДжаз даёт саммари и поручения из коробки и связан с ГигаЧатом. Яндекс Телемост делает расшифровку и итоги встречи в пару кликов. КТолк ориентирован на корпоративный контур и отечественную инфраструктуру.

ИИ-секретарь прямо во встрече: SaluteJazz, Яндекс Телемост, Контур.Толк
Протокол собирается внутри звонка, отдельный файл и отдельная загрузка не нужны. Слайд из курса

Плюс очевидный — переносить и настраивать нечего. Минус тоже стоит назвать. Вы получаете то качество и ту структуру протокола, которые заложил сервис, промтом это не управляется. Для планёрки такой протокол обычно достаточен. Для переговоров, по итогам которых пишется договор, я бы всё-таки сохранял запись и держал под рукой дословную расшифровку.

И отдельно про этикет, который в этом сценарии нарушается чаще всего. Участников встречи предупреждают о записи и об ИИ-обработке до её начала. Предупреждение постфактум эту задачу уже не закрывает. Чувствительные совещания проводят только в сервисе, согласованном со службой безопасности.

Граница проходит по персональным данным

Запись совещания и особенно собеседования — плотный персональный след. Фамилии, должности, зарплатные ожидания, оценки коллег, названия клиентов, суммы сделок, иногда здоровье и семейные обстоятельства. Всё это попадает в расшифровку дословно, потому что задача распознавания в том и состоит, чтобы ничего не потерять.

Работает здесь общее правило трёх зон данных. Свободно отправляется то, что и так публично. Обезличенно — то, из чего удалены идентификаторы. Никогда в облако — то, что защищено законом или коммерческой ценностью само по себе. Запись внутренней встречи почти всегда попадает во вторую зону, а запись собеседования и разговора с клиентом сплошь и рядом в первую.

До первой загрузки полезно ответить на три вопроса. Где физически выполняется распознавание — в российском облаке или внутри контура организации. Попадают ли персональные данные дальше, в языковую модель, и в какую именно. Кто внутри компании имеет доступ к записям и расшифровкам, и сколько они хранятся.

На занятиях я показываю этот момент демонстрацией. Файл расшифровки перетаскивается в публичную модель, промт про нормализацию отрабатывает за полминуты, результат выглядит отлично. И ровно здесь я проговариваю, что мы только что сделали шаг за границу зоны — с учебным файлом это допустимо, с записью реального совещания требует решения, принятого заранее. Именно так, кстати, и была устроена работа в кейсе с собеседованиями. Записи обрабатывались внутри организации, и это в нём главное. Сам факт расшифровки здесь вторичен.

Практический выход из ситуации известен. Обезличивание оформляется отдельным техническим шагом до отправки. Пожеланием в промте эта задача не решается. Для сценариев с высокой ценой ошибки порядок внедрения подробно разобран в статье «Как безопасно внедрить генеративный ИИ в банке» — паспорт сценария и ответственный за результат нужны и здесь.

Что ломается на практике

Распознавание речи работает хорошо, но у него есть предсказуемые слабые места, и лучше знать о них заранее.

Разделение говорящих сбивается на перебиваниях. Когда двое говорят одновременно, реплики склеиваются или уходят не тому участнику, и в протоколе появляется поручение, выданное не тем человеком. Терминология и фамилии распознаются хуже общей речи — редкое название продукта превращается в похожее знакомое слово. Плохой микрофон в переговорке роняет качество сильнее, чем любая настройка сервиса.

Отдельно про соблазн отдать звук напрямую мультимодальной языковой модели, минуя сервис распознавания. Текст на выходе получается заметно красивее — с абзацами, пунктуацией и связными формулировками. Я сравнивал такие результаты с расшифровкой на одном и том же файле. В гладком варианте появлялись специфические термины, которых в записи не было вовсе. Модель ведёт себя как стажёр с красным дипломом, который постеснялся признаться, что не расслышал, и дописал по смыслу. Поэтому распознавание я оставляю специализированному сервису, а языковую модель ставлю следующим шагом уже по тексту. Механика этой уверенной выдумки разобрана в статье «Почему нейросеть выдумывает факты».

И общее правило, которое не отменяется никакой точностью распознавания. Протокол остаётся черновиком, пока его не прочитал человек, который был на встрече. Суммы, даты и фамилии проверяются глазами. Пять минут вычитки закрывают основную часть риска, и они всё равно несопоставимы с часом, который занимает написание протокола руками.

С чего начать на этой неделе

Возьмите одну запись, которая у вас уже есть. Планёрку, разговор с клиентом, интервью с сотрудником — что угодно длиной около часа. Расшифруйте её, прогоните через промт выше и сравните полученный протокол с тем, что вы сами помните об этой встрече. Всё упражнение стоит около десяти рублей и занимает вечер.

После этого разговор о внедрении становится предметным. Вы уже знаете, какое качество даёт ваш микрофон, где сбивается разделение говорящих и сколько правок требует протокол. И становится видно главное — сколько материала лежит в архиве записей, к которому за всё время никто не возвращался.

Обзор остальных инструментов под рабочие задачи собран в «Чемоданчике ИИ-инструментов». Расшифровка среди них — самая дешёвая позиция с самым коротким путём до результата.