Как технически реализовать транскрибацию речи в текст с использованием сервисов Яндекса?

Author: Сергей Владимирович

Разберём, как технически реализовать транскрибацию речи в текст с использованием сервисов Яндекса — понятно и по шагам. Основной инструмент для этого — Yandex SpeechKit, часть экосистемы Yandex Cloud. Он отлично подходит для задач вроде твоего «умного секретаря». 🔧 Что делает Yandex SpeechKit? Это облачный сервис распознавания речи, который: - Превращает аудиозапись в текст. - Поддерживает русский язык и специализированные модели (например, для разговоров, лекций, звонков). - Автоматически расставляет знаки препинания. - Работает с длинными аудиофайлами (до нескольких часов). - Интегрируется через API. ✅ Пошаговая реализация транскрибации Шаг 1: Подготовка в Yandex Cloud 1. Создай аккаунт на https://cloud.yandex.ru 2. Создай облако и каталог (например, transcriber-project) 3. Получи стартовый грант — новых пользователей часто обеспечивают бесплатными кредитами (например, 10 000 рублей), которых хватит на тысячи минут транскрибации. Шаг 2: Настройка доступа 1. Создай сервисный аккаунт — виртуального "пользователя" для доступа к API. 2. Выдай ему роль editor (или ai.speechkit.user, если точнее). 3. Создай API-ключ: - Перейди в сервисный аккаунт → "Ключи доступа" → "Создать статический ключ". - Сохрани ID ключа и секретный ключ — они понадобятся для авторизации. 💡 Запомни: folder_id (ID каталога) и API-ключ — главные "пароли" к сервису. Шаг 3: Подготовка аудиофайла SpeechKit принимает аудио в форматах: - OggOpus — лучший выбор (маленький размер, высокое качество). - LPCM (.wav) — без сжатия, идеально, но файлы большие. - MP3 — поддерживается, но не рекомендуется из-за потерь. ✅ Совет: если запись идёт с телефона, лучше сохранять в .ogg с кодеком Opus. Шаг 4: Загрузка в Object Storage (для длинных файлов) Если аудио дольше 1 минуты, нужно: 1. Создать бакет в Yandex Object Storage (аналог S3). 2. Загрузить туда аудиофайл. 3. Получить публичную ссылку, например: https://storage.yandexcloud.net/my-bucket/record.ogg Шаг 5: Запрос к API SpeechKit Отправляешь POST-запрос на распознавание. Пример через curl: `bash curl -X POST \ -H "Authorization: Api-Key YOURAPIKEY" \ -H "Content-Type: application/json" \ -d '{ "config": { "specification": { "languageCode": "ru-RU", "model": "general", "profanityFilter": false, "audioEncoding": "OggOpus", "sampleRateHertz": 48000 } }, "audio": { "uri": "https://storage.yandexcloud.net/my-bucket/record.ogg" } }' \ https://transcribe.api.cloud.yandex.net/speech/stt/v2/longRunningRecognize ` Замени YOURAPIKEY и uri на свои. Шаг 6: Получение результата API вернёт operation_id. Через него можно проверить статус: `bash curl -H "Authorization: Api-Key YOURAPIKEY" \ https://operation.api.cloud.yandex.net/operations/OPERATION_ID ` Когда статус станет DONE, в ответе получишь полный текст с временными метками (если нужно): `json { "result": { "chunks": [ { "alternatives": [ { "text": "Привет, это мой голосовой секретарь", "confidence": 1 } ], "startTime": "0.0s", "endTime": "2.5s" } ] } } ` Шаг 7: Отправка текста на email После получения текста: - Можно использовать серверный скрипт (на Python, Node.js и т.д.). - Подключить SMTP или сервис вроде Yandex 360 / Gmail API. - Автоматически отправлять письмо с расшифровкой. Пример на Python (через smtplib): `python import smtplib from email.mime.text import MIMEText msg = MIMEText("Привет, это мой голосовой секретарь") msg['Subject'] = 'Новая расшифровка' msg['From'] = 'bot@yoursite.ru' msg['To'] = 'roman@yoursite.ru' with smtplib.SMTP('smtp.yandex.ru', 587) as server: server.starttls() server.login('bot@yoursite.ru', 'password') server.send_message(msg) ` 🧠 Автоматизация на устройстве Ты можешь сделать так, чтобы твой «телефон-секретарь»: 1. Записывал голос (например, по нажатию кнопки). 2. Сохранял файл в формате .ogg. 3. Через Wi-Fi отправлял его в Object Storage. 4. Запускал транскрибацию через API. 5. Ждал результат и отправлял текст на email. Для этого понадобится микрокомпьютер (например, Raspberry Pi) или Android-устройство с кастомным приложением. 💰 Сколько это стоит? - Распознавание 1 минуты речи — около 60 копеек. - 1 час аудио → ~36 рублей. - Стартовый грант покрывает сотни часов — бесплатно. 🔄 Альтернатива: Готовые решения Если не хочется писать код с нуля: - IT-Solution для Битрикс24 — как упоминалось в источнике, интегрирует SpeechKit прямо в CRM. - Голосовые роботы в Телеграм — можно сделать бота, который принимает голосовые и присылает текст. 📌 Вывод Ты можешь создать автономный голосовой секретарь, который: - Записывает речь. - Отправляет в Yandex SpeechKit. - Получает текст. - Присылает его на email — полностью автоматически.

Как технически реализовать транскрибацию речи в текст с использованием сервисов Яндекса?

NoteСергей Владимирович02/09/2026, 05:10:56 PM
Open in Explorer

SeqNo

3030968-1

Type

Note

Fee

0.008688

Size

8588 B

Creator

77ueq3kNSzpPGUAaerpMhC6DZbUKT55FMa

Signature

4h6VAeWr15LjoU5drLHMjrjj1yh6KuyGAiZYUtfd7JAJTPDfncRyk4nRZAtsRKoQutmLK91DAWuyj78NDeZ5BvLu

Content

Как технически реализовать транскрибацию речи в текст с использованием сервисов Яндекса?

Сергей Владимирович

Разберём, как технически реализовать транскрибацию речи в текст с использованием сервисов Яндекса — понятно и по шагам. Основной инструмент для этого — Yandex SpeechKit, часть экосистемы Yandex Cloud. Он отлично подходит для задач вроде твоего «умного секретаря».


🔧 Что делает Yandex SpeechKit?

Это облачный сервис распознавания речи, который:

  • Превращает аудиозапись в текст.
  • Поддерживает русский язык и специализированные модели (например, для разговоров, лекций, звонков).
  • Автоматически расставляет знаки препинания.
  • Работает с длинными аудиофайлами (до нескольких часов).
  • Интегрируется через API.

✅ Пошаговая реализация транскрибации

Шаг 1: Подготовка в Yandex Cloud

  1. Создай аккаунт на https://cloud.yandex.ru
  2. Создай облако и каталог (например, transcriber-project)
  3. Получи стартовый грант — новых пользователей часто обеспечивают бесплатными кредитами (например, 10 000 рублей), которых хватит на тысячи минут транскрибации.

Шаг 2: Настройка доступа

  1. Создай сервисный аккаунт — виртуального "пользователя" для доступа к API.
  2. Выдай ему роль editor (или ai.speechkit.user, если точнее).
  3. Создай API-ключ:
    • Перейди в сервисный аккаунт → "Ключи доступа" → "Создать статический ключ".
    • Сохрани ID ключа и секретный ключ — они понадобятся для авторизации.

💡 Запомни: folder_id (ID каталога) и API-ключ — главные "пароли" к сервису.


Шаг 3: Подготовка аудиофайла

SpeechKit принимает аудио в форматах:

  • OggOpus — лучший выбор (маленький размер, высокое качество).
  • LPCM (.wav) — без сжатия, идеально, но файлы большие.
  • MP3 — поддерживается, но не рекомендуется из-за потерь.

✅ Совет: если запись идёт с телефона, лучше сохранять в .ogg с кодеком Opus.


Шаг 4: Загрузка в Object Storage (для длинных файлов)

Если аудио дольше 1 минуты, нужно:

  1. Создать бакет в Yandex Object Storage (аналог S3).
  2. Загрузить туда аудиофайл.
  3. Получить публичную ссылку, например:
    https://storage.yandexcloud.net/my-bucket/record.ogg

Шаг 5: Запрос к API SpeechKit

Отправляешь POST-запрос на распознавание. Пример через curl:

curl -X POST   
  -H "Authorization: Api-Key YOUR_API_KEY"   
  -H "Content-Type: application/json"   
  -d '{
    "config": {
      "specification": {
        "languageCode": "ru-RU",
        "model": "general",
        "profanityFilter": false,
        "audioEncoding": "OggOpus",
        "sampleRateHertz": 48000
      }
    },
    "audio": {
      "uri": "https://storage.yandexcloud.net/my-bucket/record.ogg"
    }
  }'   
  https://transcribe.api.cloud.yandex.net/speech/stt/v2/longRunningRecognize

Замени YOUR_API_KEY и uri на свои.


Шаг 6: Получение результата

API вернёт operation_id. Через него можно проверить статус:

curl -H "Authorization: Api-Key YOUR_API_KEY"   
  https://operation.api.cloud.yandex.net/operations/OPERATION_ID

Когда статус станет DONE, в ответе получишь полный текст с временными метками (если нужно):

{
  "result": {
    "chunks": [
      {
        "alternatives": [
          {
            "text": "Привет, это мой голосовой секретарь",
            "confidence": 1
          }
        ],
        "startTime": "0.0s",
        "endTime": "2.5s"
      }
    ]
  }
}

Шаг 7: Отправка текста на email

После получения текста:

  • Можно использовать серверный скрипт (на Python, Node.js и т.д.).
  • Подключить SMTP или сервис вроде Yandex 360 / Gmail API.
  • Автоматически отправлять письмо с расшифровкой.

Пример на Python (через smtplib):

import smtplib
from email.mime.text import MIMEText

msg = MIMEText("Привет, это мой голосовой секретарь")
msg['Subject'] = 'Новая расшифровка'
msg['From'] = 'bot@yoursite.ru'
msg['To'] = 'roman@yoursite.ru'

with smtplib.SMTP('smtp.yandex.ru', 587) as server:
    server.starttls()
    server.login('bot@yoursite.ru', 'password')
    server.send_message(msg)

🧠 Автоматизация на устройстве

Ты можешь сделать так, чтобы твой «телефон-секретарь»:

  1. Записывал голос (например, по нажатию кнопки).
  2. Сохранял файл в формате .ogg.
  3. Через Wi-Fi отправлял его в Object Storage.
  4. Запускал транскрибацию через API.
  5. Ждал результат и отправлял текст на email.

Для этого понадобится микрокомпьютер (например, Raspberry Pi) или Android-устройство с кастомным приложением.


💰 Сколько это стоит?

  • Распознавание 1 минуты речи — около 60 копеек.
  • 1 час аудио → ~36 рублей.
  • Стартовый грант покрывает сотни часов — бесплатно.

🔄 Альтернатива: Готовые решения

Если не хочется писать код с нуля:

  • IT-Solution для Битрикс24 — как упоминалось в источнике, интегрирует SpeechKit прямо в CRM.
  • Голосовые роботы в Телеграм — можно сделать бота, который принимает голосовые и присылает текст.

📌 Вывод

Ты можешь создать автономный голосовой секретарь, который:

  • Записывает речь.
  • Отправляет в Yandex SpeechKit.
  • Получает текст.
  • Присылает его на email — полностью автоматически.

Comments

Sign in to leave a comment
Loading files...
Loading attachments...