Audio
Transcription
by OpenAI
Whisper-based speech-to-text with timestamps, diarisation, and translation for long recordings.
Capabilities
- Speech to text
- Timestamps
- Translation
Available models
Pass any of these IDs in the model field.
| Model ID | Detail | Price |
|---|---|---|
| whisper-v3 | per minute | $0.006 / minute |
| gpt-4o-transcribe | per minute | $0.010 / minute |
Pricing starts at
$0.006 / minute
Pay only for what you use. Each response returns the exact amount settled against your balance — no subscriptions, no minimums.
Quickstart
Transcription · whisper-v3
cURL
curl -X POST https://capi.ai/api/v1/audio/speech \
-H "Authorization: Bearer YOUR_API_TOKEN" \
-H "Content-Type: application/json" \
-d '{"model":"whisper-v3","input":"Welcome to CAPI."}' \
--output out.mp3More Audio models
View allAudio
ElevenLabs
ElevenLabs
ElevenLabs API access for voice synthesis, text-to-speech, sound effects, speech-to-text, and audio isolation.
from $0.040 / 1K charsView
Audio
Fish Audio
Fish Audio
Fish Audio API access for expressive multilingual and production-grade text-to-speech with managed MP3 or WAV output.
from $0.0000 / 1K UTF-8 bytesView
Audio
Gemini TTS
Gemini TTS API access for multi-speaker dialogue with configurable voices, accents, delivery styles, and pacing.
from $0.0014 / 1K tokensView