Das Richtige zwischenzuspeichern hält Sie unter dem Rate Limit und reduziert Latenz. Die Regel: statische Referenzen cachen, nie den generierten Content eines anderen Unternehmens cachen.
Sicher zu cachen
- Die Modellliste (
GET /api/v1/ai/models) — ändert sich selten; für Minuten cachen. - API-Metadaten und Capability-Deskriptoren — für Minuten cachen.
- Ihre eigenen gespeicherten Completion — nur bei server-seitiger Persistenz.
Diese Antworten enthalten Cache-Control- und ETag-Header:
Cache-Control: public, max-age=300
ETag: "a1b2c3"Nutzen Sie konditionale Anfragen mit If-None-Match zur günstigen Revalidierung.
Nicht cachen
- Generierte Chat-Completions und Tool-Ergebnisse — sie sind unternehmensspezifisch und können private Geschäftsdaten enthalten.
- Alles, das nur nach Anfragekörper ohne Unternehmensisolierung geschlüsselt ist.
Empfehlungen clientseitig
1. Cachen Sie /ai/models für ~5 Minuten.
2. Senden Sie If-None-Match bei der Revalidierung.
3. Beachten Sie X-RateLimit-Remaining und backoffen Sie vor 429.
4. Teilen Sie niemals eine gecachte Completion über Unternehmen hinweg.Generierte Antworten werden pro Anfrage berechnet und nicht aus einem geteilten Edge-Cache ausgeliefert. Das hält Mandantendaten isoliert und erlaubt Ihnen dennoch, die kleinen, stabilen Referenzdaten zu cachen.
War dieser Artikel hilfreich?
