Skip to main content
Os limites de taxa variam por modelo e tier. Os limites padrão abaixo são uma referência útil, mas o endpoint /api_keys/rate_limits da API é a forma canônica de buscar seus limites atuais. Você pode verificar seus limites exatos a qualquer momento:

Veja seus limites

Playground interativo

Logs de limite de taxa

Veja quais requisições atingiram limites

Limites padrão

Modelos de texto e embedding

Os modelos de texto e embedding são agrupados em quatro tamanhos. Cada cartão de modelo na página de modelos exibe seu badge de tamanho. Todo modelo de embedding é XS.
Alguns modelos rodam em infraestrutura dedicada ou de terceiros e têm limites que não correspondem a esses quatro tamanhos. Chame GET /api_keys/rate_limits para obter os limites autoritativos por modelo da sua chave.

Modelos de imagem e áudio

Modelos de vídeo e música

A geração de vídeo e música não tem limite de taxa. Ambas são cobradas por geração contra seu saldo de créditos, então a restrição prática é o custo, e não um teto de requisições. Calcule o preço de um job primeiro com POST /video/quote ou POST /audio/quote.

Tratamento de erros

Requisições com falha (500, 503, 429) devem ser repetidas com backoff exponencial. Para erros 429 especificamente, verifique o cabeçalho x-ratelimit-reset-requests para o timestamp Unix exato em que você pode tentar novamente. A maioria das bibliotecas HTTP tem mecanismos de retry integrados que tratam isso automaticamente.

Orçamentos de erro

Dois limites adicionais protegem a API contra clientes que fazem retry contra uma parede. Ambos são contados por modelo e por chave de API em uma janela deslizante de 30 segundos, e ambos retornam 429: O segundo orçamento conta requisições que pedem a um modelo um recurso que ele não suporta. Por exemplo, solicitar visão ou chamada de ferramentas de um modelo sem essa capacidade. Exceder qualquer um dos orçamentos aparece nos logs de limite de taxa como FAILED_REQUESTS ou UNSUPPORTED_FEATURE_REQUESTS. Ambos retornam uma customMessage indicando o limite que foi acionado:
Essas respostas definem x-ratelimit-remaining e x-ratelimit-resets em vez dos cabeçalhos por janela abaixo.

Cabeçalhos de resposta

Toda resposta inclui estes cabeçalhos: O endpoint /crypto/rpc/{network} usa seus próprios limites e seus próprios cabeçalhos X-RateLimit-Limit, X-RateLimit-Remaining e X-RateLimit-Reset, que são definidos apenas em respostas 429. Consulte Crypto RPC para detalhes.

Tier Partner

Os limites Partner estão listados junto aos limites padrão nas tabelas acima. Se você está atingindo seus limites de taxa consistentemente e seus padrões de uso mostram demanda sustentada ao longo do tempo, entre em contato para discutir acesso de parceiro: api@venice.ai. Os limites do tier Partner podem ser ajustados com base em suas necessidades específicas.