Skip to main content
Ottili AI API

Ottili AI API — Rate Limits

Wie Rate Limiting in der öffentlichen Ottili AI API funktioniert, welche Response-Header zurückgegeben werden und wie Sie sicher backoffen.

Die Ottili AI API ist pro Unternehmen, pro Workspace und pro API-Key ratenbegrenzt. Die Limits schützen die geteilte Infrastruktur und werden bei jeder Antwort zurückgegeben.

Response-Header

Erfolgreiche und gedrosselte Antworten enthalten diese Header:

X-RateLimit-Limit: 600
X-RateLimit-Remaining: 597
X-RateLimit-Reset: 1752364800
HeaderBeschreibung
X-RateLimit-LimitMaximale Anfragen im aktuellen Fenster.
X-RateLimit-RemainingVerbleibende Anfragen im aktuellen Fenster.
X-RateLimit-ResetUnix-Timestamp des Fenster-Resets.

Wenn Sie begrenzt werden

Bei Überschreitung antwortet die API mit HTTP 429 Too Many Requests und einem Retry-After-Header:

HTTP/1.1 429 Too Many Requests
Retry-After: 12
{
  "code": "RATE_LIMIT_EXCEEDED",
  "message": "Too many AI API requests. Please retry after the indicated delay."
}

Backoff

Implementieren Sie exponentiellen Backoff unter Nutzung von Retry-After:

import time, requests

def complete_with_retry(url, headers, body, max_retries=4):
    for attempt in range(max_retries):
        r = requests.post(url, headers=headers, json=body)
        if r.status_code != 429:
            return r
        wait = int(r.headers.get("Retry-After", 2 ** attempt))
        time.sleep(wait)
    raise RuntimeError("Rate limited after retries")

Authentifizierte, gescopete Anfragen erhalten höhere Limits als anonymer Traffic. Cachen Sie statische Metadaten und Modelllisten, um deutlich unter dem Limit zu bleiben.

War dieser Artikel hilfreich?