> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelos de fala para texto

> Modelos de fala para texto da Venice como Whisper Large V3 e ElevenLabs Scribe, com suporte multilíngue, timestamps e preços por segundo.

<div id="model-search-placeholder" data-filter="asr">
  Use o valor `id` como o parâmetro `model` nas requisições à API. 5 modelos disponíveis atualmente.

  | Modelo                | ID                            | Por segundo de áudio | Privacidade |
  | --------------------- | ----------------------------- | -------------------- | ----------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002             | Anonimizado |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001             | Privado     |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001             | Privado     |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001             | Privado     |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000             | Anonimizado |
</div>

***

## Uso

Modelos de fala para texto transcrevem áudio falado em texto escrito. Eles são acessados pela [API de transcrições de áudio](/pt-BR/api-reference/endpoint/audio/transcriptions).

### Formatos de áudio suportados

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

Um arquivo é aceito quando seu tipo MIME ou sua extensão está nesta lista, e ele também precisa passar em uma verificação de magic bytes sobre os bytes enviados. Renomear um arquivo para uma extensão suportada não é suficiente.

### Formatos de resposta

| Formato | Descrição                                                                               |
| ------- | --------------------------------------------------------------------------------------- |
| `json`  | Padrão. Retorna `{ "text": "..." }`, mais `duration` e `timestamps` quando disponíveis. |
| `text`  | Texto transcrito puro.                                                                  |

### Timestamps

Defina `timestamps: true` para receber dados de tempo junto com a transcrição. A resposta adiciona um objeto `timestamps` cuja granularidade depende do modelo:

| Modelo                        | Granularidade |
| ----------------------------- | ------------- |
| `elevenlabs/scribe-v2`        | `word`        |
| `stt-xai-v1`                  | `word`        |
| `openai/whisper-large-v3`     | `segment`     |
| `fal-ai/wizper`               | `segment`     |
| `nvidia/parakeet-tdt-0.6b-v3` | Nenhuma       |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3` é o modelo padrão, e ele aceita `timestamps: true` sem retornar tempos. Não há erro nem aviso — a resposta simplesmente contém `text` e nada mais. Se você precisar de tempos, escolha um modelo da tabela acima e verifique se a chave `timestamps` está presente antes de lê-la.
</Warning>

Entradas de palavra são `{ "word": "...", "start": 0.0, "end": 0.5 }` e entradas de segmento são `{ "text": "...", "start": 0.0, "end": 3.2 }`, com todos os tempos em segundos.

<Note>
  A cobrança é por segundo de áudio de entrada. Veja a [API de transcrições de áudio](/pt-BR/api-reference/endpoint/audio/transcriptions) para exemplos de requisição e detalhes dos parâmetros.
</Note>
