Skip to main content
I rate limit variano in base al modello e al tier. I limiti predefiniti qui sotto sono un riferimento utile, ma l’endpoint API /api_keys/rate_limits è il modo canonico per ottenere i tuoi limiti correnti. Puoi controllare i tuoi limiti esatti in qualsiasi momento:

Visualizza i tuoi limiti

Playground interattivo

Log dei rate limit

Scopri quali richieste hanno raggiunto i limiti

Limiti predefiniti

Modelli di testo ed embedding

I modelli di testo ed embedding sono raggruppati in quattro dimensioni. Ogni card di modello sulla pagina Modelli mostra il badge della propria dimensione. Tutti i modelli di embedding sono XS.
Alcuni modelli funzionano su infrastruttura dedicata o di terze parti e hanno limiti che non corrispondono a queste quattro dimensioni. Chiama GET /api_keys/rate_limits per i limiti autorevoli per modello sulla tua chiave.

Modelli di immagini e audio

Modelli video e musicali

La generazione di video e musica non è soggetta a rate limit. Entrambe vengono fatturate per generazione sul tuo saldo di crediti, quindi il vincolo pratico è il costo piuttosto che un tetto di richieste. Stima prima il prezzo di un job con POST /video/quote o POST /audio/quote.

Gestione degli errori

Le richieste fallite (500, 503, 429) dovrebbero essere ritentate con backoff esponenziale. Per gli errori 429 specificamente, controlla l’header x-ratelimit-reset-requests per il timestamp Unix esatto in cui puoi riprovare. La maggior parte delle librerie HTTP dispone di meccanismi di retry integrati che gestiscono questo automaticamente.

Budget di errore

Due ulteriori limiti proteggono l’API dai client che continuano a ritentare contro un muro. Entrambi vengono conteggiati per modello e per chiave API su una finestra mobile di 30 secondi, ed entrambi restituiscono 429: Il secondo budget conteggia le richieste che chiedono a un modello una funzionalità che non supporta, ad esempio richiedere visione o tool calling a un modello privo di tale capacità. Il superamento di uno dei due budget appare nei log dei rate limit come FAILED_REQUESTS o UNSUPPORTED_FEATURE_REQUESTS. Entrambi restituiscono un customMessage che indica la soglia superata:
Queste risposte impostano x-ratelimit-remaining e x-ratelimit-resets invece degli header per finestra descritti qui sotto.

Response headers

Ogni risposta include questi header: L’endpoint /crypto/rpc/{network} usa limiti propri e i propri header X-RateLimit-Limit, X-RateLimit-Remaining e X-RateLimit-Reset, che vengono impostati solo sulle risposte 429. Vedi Crypto RPC per i dettagli.

Tier Partner

I limiti partner sono elencati accanto ai limiti predefiniti nelle tabelle qui sopra. Se raggiungi costantemente i tuoi rate limit e i tuoi pattern di utilizzo mostrano una domanda sostenuta nel tempo, contattaci per discutere l’accesso partner: api@venice.ai. I limiti del tier partner possono essere regolati in base alle tue esigenze specifiche.