> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Rate Limits

> Venice API-Rate-Limits pro Stufe, die Header zur verfügbaren Kapazität und der Umgang mit 429-Antworten.

Rate-Limits variieren je nach Modell und Stufe. Die folgenden Standardlimits sind eine hilfreiche Referenz, aber der API-Endpoint `/api_keys/rate_limits` ist die maßgebliche Quelle, um Ihre aktuellen Limits abzurufen. Sie können Ihre genauen Limits jederzeit prüfen:

<CardGroup cols={2}>
  <Card title="Ihre Limits ansehen" icon="gauge-high" href="/de/api-reference/endpoint/api_keys/rate_limits?playground=open">
    Interaktiver Playground
  </Card>

  <Card title="Rate-Limit-Logs" icon="clock-rotate-left" href="/de/api-reference/endpoint/api_keys/rate_limit_logs?playground=open">
    Sehen Sie, welche Anfragen Limits erreicht haben
  </Card>
</CardGroup>

```bash theme={null}
curl https://api.venice.ai/api/v1/api_keys/rate_limits \
  -H "Authorization: Bearer $VENICE_API_KEY"
```

## Standardlimits

### Text- und Embedding-Modelle

Text- und Embedding-Modelle sind in vier Größen gruppiert. Jede Modellkarte auf der [Models-Seite](/de/models/text) zeigt ihr Größen-Badge an. Alle Embedding-Modelle sind XS.

| Größe | Requests/min | Tokens/min | Partner-Requests/min | Partner-Tokens/min |
| :---- | -----------: | ---------: | -------------------: | -----------------: |
| XS    |          500 |  5.000.000 |                  500 |         10.000.000 |
| S     |          150 |  3.000.000 |                  300 |          6.000.000 |
| M     |          100 |  2.000.000 |                  200 |          4.000.000 |
| L     |          100 |  2.000.000 |                  150 |          3.000.000 |

<Note>
  Einige Modelle laufen auf dedizierter oder Drittanbieter-Infrastruktur und haben Limits, die sich nicht auf diese vier Größen abbilden lassen. Rufen Sie [`GET /api_keys/rate_limits`](/de/api-reference/endpoint/api_keys/rate_limits) auf, um die verbindlichen Limits pro Modell für Ihren Key zu erhalten.
</Note>

### Bild- und Audio-Modelle

| Typ                       | Requests/min | Partner-Requests/min |
| :------------------------ | -----------: | -------------------: |
| Bild, Upscale, Inpaint    |           20 |                   60 |
| Sprache und Transkription |           60 |                  120 |

### Video- und Musik-Modelle

Video- und Musikgenerierung unterliegen keinen Rate-Limits. Beide werden pro Generierung über Ihr Guthaben abgerechnet, sodass in der Praxis die Kosten und nicht eine Anfrageobergrenze die Beschränkung darstellen. Kalkulieren Sie einen Auftrag zuerst mit [`POST /video/quote`](/de/api-reference/endpoint/video/quote) oder [`POST /audio/quote`](/de/api-reference/endpoint/audio/quote).

## Fehlerbehandlung

Fehlgeschlagene Anfragen (500, 503, 429) sollten mit exponentiellem Backoff wiederholt werden.

Speziell bei 429-Fehlern prüfen Sie den Header `x-ratelimit-reset-requests` für den genauen Unix-Zeitstempel, ab dem Sie es erneut versuchen können. Die meisten HTTP-Bibliotheken verfügen über integrierte Retry-Mechanismen, die dies automatisch übernehmen.

### Fehlerbudgets

Zwei weitere Limits schützen die API vor Clients, die wiederholt gegen eine Wand laufen. Beide werden pro Modell und API-Key über ein rollierendes Fenster von 30 Sekunden gezählt, und beide geben `429` zurück:

| Budget                                     | Schwellenwert | Gilt für                          |
| :----------------------------------------- | ------------: | :-------------------------------- |
| Fehlgeschlagene Anfragen                   |   50 pro 30 s | Alle Endpoints                    |
| Anfragen nach nicht unterstützten Features |  200 pro 30 s | `/chat/completions`, `/responses` |

Das zweite Budget zählt Anfragen, die von einem Modell ein Feature verlangen, das es nicht unterstützt. Ein Beispiel ist die Anforderung von Vision oder Tool Calling bei einem Modell ohne diese Fähigkeit. Die Überschreitung eines der beiden Budgets erscheint in den [Rate-Limit-Logs](/de/api-reference/endpoint/api_keys/rate_limit_logs) als `FAILED_REQUESTS` oder `UNSUPPORTED_FEATURE_REQUESTS`.

Beide geben eine `customMessage` zurück, die den ausgelösten Schwellenwert benennt:

```
Too many failed attempts (> 50) resulting in a non-success status code. Please wait 30 seconds and try again. See https://docs.venice.ai/api-reference/rate-limiting for more information.
```

Diese Antworten setzen `x-ratelimit-remaining` und `x-ratelimit-resets` anstelle der unten aufgeführten fensterbezogenen Header.

## Response-Header

Jede Antwort enthält diese Header:

| Header                           | Beschreibung                                          |
| :------------------------------- | :---------------------------------------------------- |
| `x-ratelimit-limit-requests`     | Max. Anfragen, die im aktuellen Fenster erlaubt sind  |
| `x-ratelimit-remaining-requests` | Verbleibende Anfragen im aktuellen Fenster            |
| `x-ratelimit-reset-requests`     | Unix-Zeitstempel, wann das Fenster zurückgesetzt wird |
| `x-ratelimit-limit-tokens`       | Max. erlaubte Tokens pro Minute                       |
| `x-ratelimit-remaining-tokens`   | Verbleibende Tokens in der aktuellen Minute           |
| `x-ratelimit-reset-tokens`       | Sekunden bis zum Zurücksetzen des Token-Limits        |

Der Endpoint `/crypto/rpc/{network}` verwendet eigene Limits und eigene Header (`X-RateLimit-Limit`, `X-RateLimit-Remaining` und `X-RateLimit-Reset`), die nur bei 429-Antworten gesetzt werden. Details finden Sie unter [Crypto RPC](/de/api-reference/endpoint/crypto/rpc).

## Partner-Stufe

Partner-Limits sind in den Tabellen oben neben den Standardlimits aufgeführt.

Wenn Sie konstant Ihre Rate-Limits erreichen und Ihre Nutzungsmuster eine **anhaltende Nachfrage über die Zeit** zeigen, kontaktieren Sie uns, um über Partner-Zugang zu sprechen: [api@venice.ai](mailto:api@venice.ai).

Partner-Tier-Limits können an Ihre spezifischen Anforderungen angepasst werden.
