Media · Speech-to-text
Видео в текст
Пользователь отправляет публичную ссылку и получает метаданные, описание и расшифровку прямо в Telegram.
ПлатформыYouTube, Instagram
СтекPython, yt-dlp, FFmpeg
РазвёртываниеDocker Compose
Конвейер
Сервис проверяет ссылку и длительность, извлекает аудио, сжимает его и передаёт в модель распознавания речи.
Возможности
- валидация ссылок и длительности;
- конвертация MP3 mono 16 kHz;
- OpenAI Speech-to-Text;
- SQLite-очередь со статусами;
- лимиты пользователей;
- удаление временных файлов.
Эксплуатация
Проект подготовлен для локального запуска и Docker, содержит тесты и обработку ошибок внешних платформ.