Skip to main content
POST

Авторизация

string
обязательно
Все интерфейсы требуют аутентификации по Bearer TokenПолучение API-ключа:Перейдите на страницу управления API-ключами, чтобы получить свой API-ключДобавьте его в заголовок запроса:

Тело запроса

⚠️ Онлайн-тестирование (Try it) для этой конечной точки не поддерживаетсяИз-за ограничений на загрузку файлов используйте для тестирования:
  • Apifox / Postman — после импорта вручную измените тип параметра file на файл
  • cURL — см. примеры кода справа
  • SDK — используйте примеры SDK на разных языках программирования
string
обязательно
Аудиофайл для транскрибации (тип File)⚠️ Внимание: при тестировании через Apifox или аналогичные инструменты:
  1. После импорта вручную измените тип этого параметра на file
  2. Убедитесь, что Content-Type запроса — multipart/form-data
Поддерживаемые форматы: mp3, mp4, mpeg, mpga, m4a, wav, webmМаксимальный размер файла: 25 МБ
string
по умолчанию:"whisper-1"
обязательно
Название модели распознавания речиПример: "whisper-1"
string
Код языка аудио (формат ISO-639-1)Указание языка может повысить точность и скорость распознаванияПоддерживаемые языки включают: zh (китайский), en (английский), ja (японский), ko (корейский) и ещё 99 языковПример: "en"
string
Необязательная текстовая подсказка для задания стиля транскрибации или продолжения предыдущего аудиоМаксимум 224 токена
string
по умолчанию:"json"
Формат выводаПоддерживаемые форматы:
  • json — формат JSON (только текст)
  • text — обычный текст
  • srt — формат субтитров SRT
  • verbose_json — расширенный формат JSON (включает временные метки и метаданные)
  • vtt — формат субтитров WebVTT
number
по умолчанию:"0"
Температура сэмплирования, диапазон от 0 до 1Более высокие значения (например, 0.8) делают вывод более случайным, а более низкие (например, 0.2) — более детерминированным и стабильным

Ответ

string
Текстовое содержимое транскрибации
string
Тип задачи, всегда transcribeВозвращается только в формате verbose_json
string
Определённый или указанный код языкаВозвращается только в формате verbose_json
number
Длительность аудио (в секундах)Возвращается только в формате verbose_json
array
Массив текстовых сегментовВозвращается только в формате verbose_json