← Все проекты

Media · Speech-to-text

Видео в текст

Пользователь отправляет публичную ссылку и получает метаданные, описание и расшифровку прямо в Telegram.

ПлатформыYouTube, Instagram
СтекPython, yt-dlp, FFmpeg
РазвёртываниеDocker Compose

Конвейер

Сервис проверяет ссылку и длительность, извлекает аудио, сжимает его и передаёт в модель распознавания речи.

Возможности

  • валидация ссылок и длительности;
  • конвертация MP3 mono 16 kHz;
  • OpenAI Speech-to-Text;
  • SQLite-очередь со статусами;
  • лимиты пользователей;
  • удаление временных файлов.

Эксплуатация

Проект подготовлен для локального запуска и Docker, содержит тесты и обработку ошибок внешних платформ.

Нужна обработка медиа?

Обсудить задачу →