Skip to main content

Giới hạn tốc độ (rate limit)

Gateway giới hạn tốc độ gọi theo đội: mọi key của đội dùng chung một bộ đếm. Giới hạn tính trong cửa sổ trượt 60 giây. Vượt giới hạn, gateway trả lỗi 429. Chờ vài giây rồi gọi lại (SDK openai tự thử lại 2 lần).

Giới hạn này khác với hết budget (429 Budget has been exceeded). Hết budget thì chờ không có tác dụng.

Giới hạn chung của đội​

Key chính thứcKey test
Budget$50$1
Request mỗi phút (RPM), cộng mọi model2.88020
Token mỗi phút (TPM), cộng mọi model17.280.000100.000
Request song song mỗi key105

Giới hạn riêng từng model​

Key chính thức có thêm giới hạn riêng cho các model dưới đây. Model không có trong bảng chỉ chịu giới hạn chung của đội.

ModelGiới hạn mỗi đội
gemini-2.5-pro, gemini-3.1-pro-preview96.000 TPM
gemini-3-pro-image, nano-banana-pro48.000 TPM
gemini-2.5-flash, gemini-3.1-flash-lite, gemini-3.5-flash, gemini-3.5-flash-lite, gemini-3.6-flash, gemini-3.7-flash, gemini-3.8-flash384.000 TPM
gpt-5.6-luna, gpt-6-luna17.280.000 TPM, 2.880 RPM
o4-mini14.400.000 TPM, 2.880 RPM
gpt-5.6-sol, gpt-5.6-terra, gpt-6-sol, gpt-6.1-sol, gpt-6-astra3.840.000 TPM, 1.440 RPM
o32.880.000 TPM, 960 RPM
text-embedding-3-small, text-embedding-3-large960.000 TPM, 960 RPM
gpt-4o-mini-transcribe, gpt-4o-mini-tts768.000 TPM, 960 RPM
gpt-4o-transcribe576.000 TPM, 960 RPM
whisper-1960 RPM
omni-moderation-latest48.000 TPM, 480 RPM
gemini-3.5-transcribe-preview400.000 TPM, 300 RPM
gemini-2.5-flash-preview-tts, gemini-3.1-flash-tts-preview158 RPM
gemini-2.5-pro-preview-tts132 RPM
veo-3.1-generate-001, veo-3.1-fast-generate-001, veo-3.1-lite-generate-00152 RPM
lyria-3-pro-preview, lyria-3-clip-preview105 RPM
gpt-image-2.5-flare, gpt-image-2.5-sunburst24 RPM
gemini-2.5-flash-image, gemini-3.1-flash-image, gemini-3.1-flash-lite-image, nano-banana, nano-banana-2, nano-banana-2-lite60 RPM
  • Xem giới hạn đang áp cho đội của bạn ở trang Kiểm tra chi tiêu: nhập key, khung kết quả liệt kê từng model và giới hạn của nó.

Tránh bị 429​

  • Đặt max_tokens / max_completion_tokens vừa đủ. Khi request bắt đầu, gateway giữ chỗ trước token input + max_tokens, rồi trả lại phần không dùng khi request xong. Với model Pro (96.000 TPM), một request đặt max_tokens 65.536 chiếm gần hết giới hạn của phút đó.
  • Dùng model Flash hoặc OpenAI cho phần lớn công việc. Gemini Pro có giới hạn thấp nhất (96.000 TPM), chỉ gọi khi thật cần.
  • Không bắn quá nhiều request song song. Mỗi key chạy tối đa 10 request cùng lúc. Dùng hàng đợi và retry với exponential backoff.