> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 속도 제한

> 등급별 Venice API 속도 제한, 용량을 노출하는 헤더, 429 처리 방법.

속도 제한은 모델 및 등급에 따라 다릅니다. 아래의 기본 제한은 유용한 참고 자료이지만, `/api_keys/rate_limits` API 엔드포인트가 현재 제한을 가져오는 표준 방법입니다. 언제든지 정확한 제한을 확인할 수 있습니다:

<CardGroup cols={2}>
  <Card title="제한 보기" icon="gauge-high" href="/ko/api-reference/endpoint/api_keys/rate_limits?playground=open">
    인터랙티브 플레이그라운드
  </Card>

  <Card title="속도 제한 로그" icon="clock-rotate-left" href="/ko/api-reference/endpoint/api_keys/rate_limit_logs?playground=open">
    제한에 도달한 요청 확인
  </Card>
</CardGroup>

```bash theme={null}
curl https://api.venice.ai/api/v1/api_keys/rate_limits \
  -H "Authorization: Bearer $VENICE_API_KEY"
```

## 기본 제한

### 텍스트 및 임베딩 모델

텍스트 및 임베딩 모델은 네 가지 크기로 그룹화됩니다. [모델 페이지](/ko/models/text)의 각 모델 카드에는 해당 크기 배지가 표시됩니다. 모든 임베딩 모델은 XS입니다.

| 크기 | 요청/분 |      토큰/분 | 파트너 요청/분 |   파트너 토큰/분 |
| :- | ---: | --------: | -------: | ---------: |
| XS |  500 | 5,000,000 |      500 | 10,000,000 |
| S  |  150 | 3,000,000 |      300 |  6,000,000 |
| M  |  100 | 2,000,000 |      200 |  4,000,000 |
| L  |  100 | 2,000,000 |      150 |  3,000,000 |

<Note>
  일부 모델은 전용 인프라 또는 서드파티 인프라에서 실행되며, 이 네 가지 크기에 해당하지 않는 제한을 가집니다. 사용 중인 키에 대한 모델별 공식 제한은 [`GET /api_keys/rate_limits`](/ko/api-reference/endpoint/api_keys/rate_limits)를 호출하세요.
</Note>

### 이미지 및 오디오 모델

| 유형              | 요청/분 | 파트너 요청/분 |
| :-------------- | ---: | -------: |
| 이미지, 업스케일, 인페인트 |   20 |       60 |
| 음성 및 전사         |   60 |      120 |

### 비디오 및 음악 모델

비디오 및 음악 생성에는 속도 제한이 적용되지 않습니다. 둘 다 크레딧 잔액에서 생성 건당 청구되므로, 요청 상한이 아니라 비용이 실질적인 제약입니다. 먼저 [`POST /video/quote`](/ko/api-reference/endpoint/video/quote) 또는 [`POST /audio/quote`](/ko/api-reference/endpoint/audio/quote)로 작업 비용을 산정하세요.

## 오류 처리

실패한 요청(500, 503, 429)은 지수 백오프로 재시도해야 합니다.

특히 429 오류의 경우, 재시도할 수 있는 정확한 Unix 타임스탬프는 `x-ratelimit-reset-requests` 헤더를 확인하세요. 대부분의 HTTP 라이브러리는 이를 자동으로 처리하는 내장 재시도 메커니즘을 가지고 있습니다.

### 오류 버짓

벽에 부딪히면서도 계속 재시도하는 클라이언트로부터 API를 보호하기 위해 두 가지 추가 제한이 있습니다. 둘 다 롤링 30초 동안 API 키별, 모델별로 집계되며, 둘 다 `429`를 반환합니다:

| 버짓            |      임계값 | 적용 대상                             |
| :------------ | -------: | :-------------------------------- |
| 실패한 요청        |  30초당 50 | 모든 엔드포인트                          |
| 지원되지 않는 기능 요청 | 30초당 200 | `/chat/completions`, `/responses` |

두 번째 버짓은 모델이 지원하지 않는 기능을 요청하는 경우를 집계합니다. 예를 들어 해당 기능이 없는 모델에 비전이나 도구 호출을 요청하는 경우입니다. 두 버짓 중 하나라도 초과하면 [속도 제한 로그](/ko/api-reference/endpoint/api_keys/rate_limit_logs)에 `FAILED_REQUESTS` 또는 `UNSUPPORTED_FEATURE_REQUESTS`로 표시됩니다.

둘 다 초과된 임계값을 명시하는 `customMessage`를 반환합니다:

```
Too many failed attempts (> 50) resulting in a non-success status code. Please wait 30 seconds and try again. See https://docs.venice.ai/api-reference/rate-limiting for more information.
```

이러한 응답에는 아래의 윈도우별 헤더 대신 `x-ratelimit-remaining` 및 `x-ratelimit-resets`가 설정됩니다.

## 응답 헤더

모든 응답에는 다음 헤더가 포함됩니다:

| Header                           | Description           |
| :------------------------------- | :-------------------- |
| `x-ratelimit-limit-requests`     | 현재 윈도우에서 허용된 최대 요청    |
| `x-ratelimit-remaining-requests` | 현재 윈도우에서 남은 요청        |
| `x-ratelimit-reset-requests`     | 윈도우가 재설정되는 Unix 타임스탬프 |
| `x-ratelimit-limit-tokens`       | 분당 허용된 최대 토큰          |
| `x-ratelimit-remaining-tokens`   | 현재 분에 남은 토큰           |
| `x-ratelimit-reset-tokens`       | 토큰 제한이 재설정될 때까지의 초    |

`/crypto/rpc/{network}` 엔드포인트는 자체 제한과 자체 `X-RateLimit-Limit`, `X-RateLimit-Remaining`, `X-RateLimit-Reset` 헤더를 사용하며, 이 헤더들은 429 응답에서만 설정됩니다. 자세한 내용은 [Crypto RPC](/ko/api-reference/endpoint/crypto/rpc)를 참조하세요.

## 파트너 등급

파트너 제한은 위 표에서 기본 제한과 함께 나열되어 있습니다.

지속적으로 속도 제한에 도달하고 사용 패턴이 **시간 경과에 따른 지속적인 수요**를 보이는 경우, 파트너 액세스를 논의하기 위해 연락하세요: [api@venice.ai](mailto:api@venice.ai).

파트너 등급 제한은 특정 요구 사항에 따라 조정할 수 있습니다.
