> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Speech-to-Text-Modelle

> Venice-Speech-to-Text-Modelle wie Whisper Large V3 und ElevenLabs Scribe mit mehrsprachiger Unterstützung, Zeitstempeln und Preisen pro Sekunde.

<div id="model-search-placeholder" data-filter="asr">
  Verwenden Sie den `id`-Wert als `model`-Parameter in API-Anfragen. Derzeit sind 5 Modelle verfügbar.

  | Model                 | ID                            | Pro Audio-Sekunde | Privacy    |
  | --------------------- | ----------------------------- | ----------------- | ---------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002          | Anonymized |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001          | Private    |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001          | Private    |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001          | Private    |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000          | Anonymized |
</div>

***

## Verwendung

Speech-to-Text-Modelle transkribieren gesprochenes Audio in geschriebenen Text. Sie werden über die [Audio-Transcriptions-API](/de/api-reference/endpoint/audio/transcriptions) aufgerufen.

### Unterstützte Audioformate

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

Eine Datei wird akzeptiert, wenn entweder ihr MIME-Typ oder ihre Dateiendung auf dieser Liste steht, und sie muss zusätzlich einen Magic-Byte-Check der hochgeladenen Bytes bestehen. Das bloße Umbenennen einer Datei auf eine unterstützte Endung reicht nicht aus.

### Antwortformate

| Format | Beschreibung                                                                                   |
| ------ | ---------------------------------------------------------------------------------------------- |
| `json` | Standard. Gibt `{ "text": "..." }` zurück, plus `duration` und `timestamps`, sofern verfügbar. |
| `text` | Reiner transkribierter Text.                                                                   |

### Timestamps

Setzen Sie `timestamps: true`, um Timing-Daten zusammen mit dem Transkript zu erhalten. Die Antwort enthält dann ein `timestamps`-Objekt, dessen Granularität vom Modell abhängt:

| Modell                        | Granularität |
| ----------------------------- | ------------ |
| `elevenlabs/scribe-v2`        | `word`       |
| `stt-xai-v1`                  | `word`       |
| `openai/whisper-large-v3`     | `segment`    |
| `fal-ai/wizper`               | `segment`    |
| `nvidia/parakeet-tdt-0.6b-v3` | Keine        |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3` ist das Standardmodell, und es akzeptiert `timestamps: true`, ohne Timings zurückzugeben. Es gibt keinen Fehler und keine Warnung – die Antwort enthält einfach nur `text` und sonst nichts. Wenn Sie Timings benötigen, wählen Sie ein Modell aus der Tabelle oben und prüfen Sie, ob der Schlüssel `timestamps` vorhanden ist, bevor Sie ihn auslesen.
</Warning>

Word-Einträge sind `{ "word": "...", "start": 0.0, "end": 0.5 }` und Segment-Einträge sind `{ "text": "...", "start": 0.0, "end": 3.2 }`, wobei alle Zeiten in Sekunden angegeben sind.

<Note>
  Die Abrechnung erfolgt pro Sekunde Eingabe-Audio. Anfrage-Beispiele und Parameterdetails finden Sie in der [Audio-Transcriptions-API](/de/api-reference/endpoint/audio/transcriptions).
</Note>
