← All models
NVIDIA · Transcription model
Nemotron 3.5 ASR Streaming Multilingual 0.6B
nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b- Transcription
Nemotron 3.5 ASR Streaming Multilingual 0.6B is a speech recognition model from NVIDIA. Its prompt-conditioned, cache-aware FastConformer-RNNT design targets low-latency transcription across more than 40 languages for real-time captioning, voice...
Specifications
- Input
- wav, mp3, flac, m4a, ogg, webm, aac, opus · base64 JSON, multipart file or URL · up to 25 MB
- Output
- text; verbose_json adds language, duration, segments and word timestamps
- Billing
- per second of audio
Use it
POST /api/v1/audio/transcriptions · MCP transcribe · full reference
curl https://omnirail.org/api/v1/audio/transcriptions \ -H "Authorization: Bearer $OMNIRAIL_KEY" \ -F model=nvidia/nemotron-3.5-asr-streaming-multilingual-0.6b \ -F file=@meeting.mp3