Giới hạn tốc độ (rate limit)
Gateway giới hạn tốc độ gọi theo đội: mọi key của đội dùng chung một bộ đếm. Giới hạn tính trong cửa sổ trượt 60 giây. Vượt giới hạn, gateway trả lỗi 429. Chờ vài giây rồi gọi lại (SDK openai tự thử lại 2 lần).
Giới hạn này khác với hết budget (429 Budget has been exceeded). Hết budget thì chờ không có tác dụng.
Giới hạn chung của đội
| Key chính thức | Key test | |
|---|---|---|
| Budget | $50 | $1 |
| Request mỗi phút (RPM), cộng mọi model | 2.880 | 20 |
| Token mỗi phút (TPM), cộng mọi model | 17.280.000 | 100.000 |
| Request song song mỗi key | 10 | 5 |
Giới hạn riêng từng model
Key chính thức có thêm giới hạn riêng cho các model dưới đây. Model không có trong bảng chỉ chịu giới hạn chung của đội.
| Model | Giới hạn mỗi đội |
|---|---|
gemini-2.5-pro, gemini-3.1-pro-preview | 96.000 TPM |
gemini-3-pro-image, nano-banana-pro | 48.000 TPM |
gemini-2.5-flash, gemini-3.1-flash-lite, gemini-3.5-flash, gemini-3.5-flash-lite, gemini-3.6-flash, gemini-3.7-flash, gemini-3.8-flash | 384.000 TPM |
gpt-5.6-luna, gpt-6-luna | 17.280.000 TPM, 2.880 RPM |
o4-mini | 14.400.000 TPM, 2.880 RPM |
gpt-5.6-sol, gpt-5.6-terra, gpt-6-sol, gpt-6.1-sol, gpt-6-astra | 3.840.000 TPM, 1.440 RPM |
o3 | 2.880.000 TPM, 960 RPM |
text-embedding-3-small, text-embedding-3-large | 960.000 TPM, 960 RPM |
gpt-4o-mini-transcribe, gpt-4o-mini-tts | 768.000 TPM, 960 RPM |
gpt-4o-transcribe | 576.000 TPM, 960 RPM |
whisper-1 | 960 RPM |
omni-moderation-latest | 48.000 TPM, 480 RPM |
gemini-3.5-transcribe-preview | 400.000 TPM, 300 RPM |
gemini-2.5-flash-preview-tts, gemini-3.1-flash-tts-preview | 158 RPM |
gemini-2.5-pro-preview-tts | 132 RPM |
veo-3.1-generate-001, veo-3.1-fast-generate-001, veo-3.1-lite-generate-001 | 52 RPM |
lyria-3-pro-preview, lyria-3-clip-preview | 105 RPM |
gpt-image-2.5-flare, gpt-image-2.5-sunburst | 24 RPM |
gemini-2.5-flash-image, gemini-3.1-flash-image, gemini-3.1-flash-lite-image, nano-banana, nano-banana-2, nano-banana-2-lite | 60 RPM |
- Xem giới hạn đang áp cho đội của bạn ở trang Kiểm tra chi tiêu: nhập key, khung kết quả liệt kê từng model và giới hạn của nó.
Tránh bị 429
- Đặt
max_tokens/max_completion_tokensvừa đủ. Khi request bắt đầu, gateway giữ chỗ trướctoken input + max_tokens, rồi trả lại phần không dùng khi request xong. Với model Pro (96.000 TPM), một request đặtmax_tokens65.536 chiếm gần hết giới hạn của phút đó. - Dùng model Flash hoặc OpenAI cho phần lớn công việc. Gemini Pro có giới hạn thấp nhất (96.000 TPM), chỉ gọi khi thật cần.
- Không bắn quá nhiều request song song. Mỗi key chạy tối đa 10 request cùng lúc. Dùng hàng đợi và retry với exponential backoff.