Как превратить голосовые сообщения в текст в Telegram. Самый лучший способ
Голосовые сообщения — это, пожалуй, самое противоречивое явление современных мессенджеров. С одной стороны, они позволяют на набирать вручную большие объёмы информации, а просто наговорить заранее заготовленный текст. Но, с другой, люди в большинстве своём используют голосовые просто потому, что им лень печатать даже короткие сообщения. В результате получатель вынужден не просто найти тихое место, чтобы услышать всё правильно, но и потратить время на выслушивание лишних речевых оборотов, чтобы выцепить важное. Но теперь это не требуется, ведь в Телеграме можно перевести голосовое сообщение в текст буквально в два нажатия.
В Телеграме появился бот, который позволяет очень круто расшифровывать голосовые сообщения
На самом деле в Телеграме есть куча ботов, которые позволяют расшифровать голосовые сообщения и перевести их в текстовый формат, чтобы иметь возможность прочитать, а не выслушивать. Однако мой личный опыт показал, что абсолютное большинство из них используют бесплатные API, которые довольно посредственно преобразуют речь в текст, допуская множество ошибок. Так что для регулярного использования они явно не годятся — не от уровень.
Как читать голосовые в Телеграме

Кажется, это единственный толковый бот, который переводит голосовые в текст
Решить эту проблему взялись разработчики SberDevices. Они создали собственного телеграм-бота под названием SmartSpeech Bot для расшифровки голосовых сообщений. Я лично проверил его и уже сейчас могу сказать, что это реально полезный инструмент, которым я буду пользоваться, потому что решение и вправду получилось очень действенным. Бот грамотно преобразует голос в текстовый формат, может отличать русскоязычную речь от англоязычной и даже старается расставлять знаки препинания.
SmartSpeech Bot может работать в двух режимах — как самостоятельный бот и как часть общего чата. Я использовал его в индивидуальном режиме, но при желании вы можете добавить его к себе в группу, если такая необходимость возникнет.
- Перейдите по этой ссылке и добавьте бота себе в Телеграм;
- Нажмите «Начать», чтобы SmartSpeech Bot начал работать;

Перешлите голосовое боту, и он тут же его расшифрует
- Найдите у себя в чатах голосовое сообщение и перешлите боту;
- Спустя мгновение бот расшифрует его и представит в виде текста.
❗️МЫ ЕСТЬ В ТЕЛЕГРАМЕ. ОБЯЗАТЕЛЬНО ПОДПИСЫВАЙТЕСЬ, ПОКА БЕСПЛАТНО
Расшифрованное сообщение появится в чате с ботом, вне зависимости от того, откуда вы переслали голосовое сообщение. То есть в беседе с пользователем, который записал вам вербальное послание, ничего лишнего не появится. Он вообще не узнает о том, что вы не стали слушать его сообщение, а предпочли перевести в текст и прочитать.
Мне очень понравилось, как SmartSpeech Bot расшифровывает голосовые сообщения. Если ваш собеседник говорит внятным языком и не проглатывает слова, бот не только представит вам текст без ошибок, но и постарается расставить запятые там, где были сделаны вербальные паузы. Знаки препинания появляются не всегда, да это и не самое главное. Но круто, что бот умеет в в пунктуацию.
Голосовые сообщения в текст

Бот очень грамотно переводит голосовые сообщения в текст, распознавания даже английские слова и названия брендов
Куда круче, как по мне, способность распознавать и русский, и английский язык. Причём бот понимает не только язык как таковой, но и знает названия брендов, которые, в общем говоря, не находятся на слуху. Например, он без проблем распознал в своих сообщениях слова SberDevices и MacBook Air, когда я говорил по-русски, сумев отделить одно от другого. Обычно боты с этим справляются довольно посредственно, а тут — зачёт.
❗️В ТЕЛЕГРАМ-КАНАЛЕ СУНДУК АЛИБАБЫ КАЖДЫЙ ДЕНЬ ВЫХОДЯТ ПОДБОРКИ ЛУЧШИХ ТОВАРОВ С АЛИЭКСПРЕСС
А вот, если говорить не очень внятно, намеренно коверкать слова, как мы нередко делаем это в повседневном общении, бот Сбера может слажать. В принципе, ошибки, которые он допускает, не критичны. Да и ошибками это назвать можно лишь с натяжкой. Просто он пытается переводить слова-паразиты типа «чё» в «что» и т.д., делая итоговый результат более грамотным, чем исходник, из-за чего случаются некоторые казусы в восприятии.
В целом, SmartSpeech Bot от SberDevices — это реально лучшее решение для преобразования голосовых сообщений в текст из того, что мне попадалось. Я испытал штук 5-6 разных ботов и в итоге не остановил своего выбора ни на одном, решив, что лучше буду слушать речь своих собеседников, нежели пытаться разгадывать, что напереводили боты. Но с этой штукой такого ощущения больше нет. Я обязательно сохраню себе его для последующего использования. Пригодится.
Как в Telegram переводить голосовые сообщения в текст
Функциональность Telegram постоянно расширяется за счет ботов, которые выполняют самые разнообразные функции. Так что мессенджер вышел уже далеко за рамки своего изначального назначения. Ботов пишут как студенты, так и серьезные компании, ведь сфера применения этого инструмента кажется безграничной.

Разработчики из SberDevices, являющиеся частью компаний «Сбера» тоже создали своего бота для Telegram. С его помощью можно превращать голосовые русскоязычные аудио-сообщения в обычной текст.
Естественно, столь продвинутые возможности базируются на определенном фундаменте. Им стала платформа распознавания речи SmartSpeech. Ею «Сбер» уже пользуется, в частности, для работы своего виртуального ассистента «Салют». Система распознавания голоса помогает намного эффективнее работать журналистам, копирайтерам, переводчикам и людям других профессий, которые связаны с написанием или обработкой текстов.
Для работы телеграм-бота требуется аудиофайл или голосовое сообщение на русском языке в формате MP3, WAV (8-96 кГц), FLAC или OggOpus. Размер файла не должен превышать 20 Мбайт. А дальше задействуется платформа SmartSpeech с реализованной на ней технологией распознавания речи (Automatic Speech Recognition, ASR). Бизнесу предлагается использовать ее в качестве интерфейса голосового ввода, к примеру, на веб-сайтах.
Платформа SmartSpeech интересна еще и тем, что у нее есть возможность генерации речи с помощью технологии Text to speech (TTS). Так тексты получают аудио-сопровождение, можно создавать целые ролики. В рамках сервиса подобные технологии позволяют создавать интерактивные голосовые меню (IVR), подключать голосового ассистента, делать озвучку контента и многое другое.
Сама платформа SmartSpeech может быть использована компаниями различных отраслей и размеров, в том числе и в транспорте, медицине, туризме, электронной коммерции. Именно с ней сталкиваются клиенты «Сбера» при звонке на номер 900, чтобы в любое время, не дожидаясь ответа оператора, получить ответы на стандартные вопросы. Например, можно узнать баланс своей банковской карты.
Бесплатный Telegram-бот для расшифровки аудио. Рассказываем кратко, как мы его сделали
Команда SberDevices запустила бесплатный бот в Telegram, который конвертирует русскоязычные голосовые сообщения и аудиофайлы в текстовый формат. Бот работает на основе технологии распознавания речи SmartSpeech и станет удобным инструментом для журналистов, копирайтеров, переводчиков и представителей других профессий, которые работают с текстами. Он позволит сэкономить часы работы, сократить рутину и значительно повысит эффективность при производстве контента. Также бот незаменим в ситуациях, когда у пользователя нет возможности прослушать голосовое сообщение: на встрече или в общественном транспорте. Бот можно использовать как в личной переписке, так и добавлять в групповые чаты. Он обеспечивает расшифровку голосовых сообщений и загруженных одноканальных аудиофайлов до 20 Мб в кодировках MP3, WAV (8-96 кГц), FLAC и OggOpus.
Что под капотом
При создании Telegram-бота мы использовали особую модель распознавания речи. Она очень похожа на ту, которая используется в работе виртуальных ассистентов Салют — как по архитектуре, так и по количеству параметров. Однако у этой модели есть существенное отличие — оно в обучающих данных.
Главной задачей наших моделей, используемых виртуальными ассистентами, является распознавание запроса: команды или вопроса (“Салют, включи спокойную музыку”, “Джой, сколько сейчас градусов”). Обычно это очень короткие фразы. Кроме того, важная особенность таких моделей — игнорирование фоновой речи и речи, не обращённой непосредственно к виртуальному ассистенту.
Когда мы попробовали использовать существующие модели для распознавания аудиосообщений, очевидно, не получили необходимого качества: аудиосообщения зачастую длинные, а распознавать нужно весь запрос, не пропуская ни одного слова.
Отлично. Проблема найдена, переходим к решению.
Сначала мы собрали из различных открытых источников длинные монологи, от нескольких десятков секунд до нескольких часов, порезали на короткие куски длиной не более 25 секунд и с помощью краудсорсинга получили для них транскрипции. А также перестали игнорировать фоновую речь.
Основная проблема такого подхода — трата большого количества времени на получение транскрипций. Процесс это долгий, и достаточное количество данных быстро таким образом не собрать. Пришлось прибегнуть к трюку.
На самом деле, модель, обученная не пропускать фоновую речь, у нас уже была – это модель, которая используется для распознавания телефонных разговоров. Однако для её обучения использовался принципиально другой звук: частота дискретизации 8кГц, а для голосовых сообщений мы взяли за основу 16кГц.
Напрямую, без потери информации, использовать её было нельзя, но с её помощью нам удалось расширить обучающую выборку. Мы взяли короткие куски монологов, для которых у нас ещё не было транскрипций, понизили их частоту до 8 кГц и сделали псевдоразметку: распознали записи с помощью модели для телефонии. Дальше просто привязали полученные транскрипции к исходному звуку с качеством 16 кГц.
Кроме того, для формирования обучающей выборки мы использовали полученные ранее аудиозаписи с транскрипциями, на которых обучалась модель телефонии, повысив частоту дискретизации.
Таким образом, нам удалось значительно увеличить обучающую выборку, перестать игнорировать фоновую речь, и, как следствие, улучшить качество распознавания аудиосообщений в нашем Telegram-боте.
Пунктуация
Бот способен расставлять знаки пунктуации и делить текст на предложения. Это довольно простая seq2seq-модель 4-классовой классификации (пустота, точка, запятая, знак вопроса), обученная на открытых данных общения из интернета. В отличие от большинства моделей, наша не анализирует текст полностью, а учитывает паузы между словами для разбиения текста на значимые части, которые анализируются независимо. Это позволяет распознавать быстрее. А ещё мы не ставим точку в конце единичного предложения — так же, как и вы при общении в мессенджере.
Бот для Telegram, который преобразовывает голосовые сообщения в текст
Голосовые сообщения это удобно, но как правило, только для отправителя. Ведь далеко не всегда эти сообщения удобно слушать. На работе, за рулем автомобиля, или же просто шумная обстановка вокруг.
Мне захотелось раз и навсегда решить эту проблему, и я написал бота для Telegram, который преобразовывает голосовые сообщения в текст.
Вы можете добавить его в любой чат, и все голосовые сообщения бот будет автоматически преобразовываться в текст:
Если нет желания добавлять бота в чат, то можете сохранить его в контактах, и по необходимости пересылать ему сообщения, а в ответ получать текстовые расшифровки:
А если среди ваших контактов нет любителей голосовых сообщений, то можете просто надиктовывать боту сообщения, и использовать их как “записную книжку”:
Добавить бота себе можно по ссылкам:
Если не получилось открыть по ссылке, то в приложении Telegram ищите в поиске по имени: @VoiceMsgBot
А мой https://t.me/voicybot поддерживает 3 движка распознавания речи на выбор, более 80 языков, распознает любые аудиофайлы и не имеет ограничения в 20мб по размеру файла для распознавания на https://voicybot.com. А, ну и пользуются и доверяют ему уже более 2 000 000 людей. Ну эт я так, для справки. А ещё у него код открыт: https://GitHub.com/backmeupplz/voicybot. Автор, можете воспользоваться 😉
Конкуренция — двигатель прогресса 😉
Честь Вам и хвала за войсибота!
Автор поста банально не изучил существующие решения. Это грубое упущение.
А вообще, у меня давно была идея (ещё до появления Telegram) сделать что-то похожее для телефонных звонков. Но сделалось вот что. И да, я тебе рассказывал как-то про свой проект. Жду всех в гости :).
Никита, а как преобразовать звуковые файлы из записей АТС менеджеров отдела продаж для дальнейшего анализа?
А на базе чего распознаёт? Амазон, Яндекс? Дорого выходит? За распознавание голоса довольно кусачие тарифы на сколько помню:/
Для любителей голосовых сообщений в аду отдельный котёл.
По соседству с любителями портативных переносные колонок.
Оооо даааа! Считаю вежливым, если перед этим спрашивают: «Можно я войс пришлю? Или напишу, но попозже». Если мне ок, то можно.
Я слушаю войсы от подруг. И всё. Понятно, что проще высказать мысль, да и мне приятно её послушать.
А по работе — тоталли нет. Потом ещё и хрен найдёшь нужную инфу, а тебе потом «Ну я же записывал войс, ну чо ты». А я визуал, запоминаю ТОЛЬКО то, что читаю глазами. Все аудио — мимо моего внимания 100%
Да, это очень удобная фича, особенно радуют заказчики дающие техзадание в виде войсмэйлов. На 10 минут
а телефонные звонки вы тоже не любите?
или речь касается только записи, не живого разговора?