Skip to main content
Rate-Limits variieren je nach Modell und Stufe. Die folgenden Standardlimits sind eine hilfreiche Referenz, aber der API-Endpoint /api_keys/rate_limits ist die maßgebliche Quelle, um Ihre aktuellen Limits abzurufen. Sie können Ihre genauen Limits jederzeit prüfen:

Ihre Limits ansehen

Interaktiver Playground

Rate-Limit-Logs

Sehen Sie, welche Anfragen Limits erreicht haben

Standardlimits

Text- und Embedding-Modelle

Text- und Embedding-Modelle sind in vier Größen gruppiert. Jede Modellkarte auf der Models-Seite zeigt ihr Größen-Badge an. Alle Embedding-Modelle sind XS.
Einige Modelle laufen auf dedizierter oder Drittanbieter-Infrastruktur und haben Limits, die sich nicht auf diese vier Größen abbilden lassen. Rufen Sie GET /api_keys/rate_limits auf, um die verbindlichen Limits pro Modell für Ihren Key zu erhalten.

Bild- und Audio-Modelle

Video- und Musik-Modelle

Video- und Musikgenerierung unterliegen keinen Rate-Limits. Beide werden pro Generierung über Ihr Guthaben abgerechnet, sodass in der Praxis die Kosten und nicht eine Anfrageobergrenze die Beschränkung darstellen. Kalkulieren Sie einen Auftrag zuerst mit POST /video/quote oder POST /audio/quote.

Fehlerbehandlung

Fehlgeschlagene Anfragen (500, 503, 429) sollten mit exponentiellem Backoff wiederholt werden. Speziell bei 429-Fehlern prüfen Sie den Header x-ratelimit-reset-requests für den genauen Unix-Zeitstempel, ab dem Sie es erneut versuchen können. Die meisten HTTP-Bibliotheken verfügen über integrierte Retry-Mechanismen, die dies automatisch übernehmen.

Fehlerbudgets

Zwei weitere Limits schützen die API vor Clients, die wiederholt gegen eine Wand laufen. Beide werden pro Modell und API-Key über ein rollierendes Fenster von 30 Sekunden gezählt, und beide geben 429 zurück: Das zweite Budget zählt Anfragen, die von einem Modell ein Feature verlangen, das es nicht unterstützt. Ein Beispiel ist die Anforderung von Vision oder Tool Calling bei einem Modell ohne diese Fähigkeit. Die Überschreitung eines der beiden Budgets erscheint in den Rate-Limit-Logs als FAILED_REQUESTS oder UNSUPPORTED_FEATURE_REQUESTS. Beide geben eine customMessage zurück, die den ausgelösten Schwellenwert benennt:
Diese Antworten setzen x-ratelimit-remaining und x-ratelimit-resets anstelle der unten aufgeführten fensterbezogenen Header.

Response-Header

Jede Antwort enthält diese Header: Der Endpoint /crypto/rpc/{network} verwendet eigene Limits und eigene Header (X-RateLimit-Limit, X-RateLimit-Remaining und X-RateLimit-Reset), die nur bei 429-Antworten gesetzt werden. Details finden Sie unter Crypto RPC.

Partner-Stufe

Partner-Limits sind in den Tabellen oben neben den Standardlimits aufgeführt. Wenn Sie konstant Ihre Rate-Limits erreichen und Ihre Nutzungsmuster eine anhaltende Nachfrage über die Zeit zeigen, kontaktieren Sie uns, um über Partner-Zugang zu sprechen: api@venice.ai. Partner-Tier-Limits können an Ihre spezifischen Anforderungen angepasst werden.