Rate Limit
Ein Rate Limit ist eine Obergrenze dafür, wie viele Anfragen ein Dienst von einem Aufrufer innerhalb eines Zeitfensters annimmt — ein paar pro Sekunde oder ein paar Hundert pro Minute —, durchgesetzt, indem der Überschuss abgelehnt wird, üblicherweise mit dem HTTP-Status 429 Too Many Requests. Oft wird es mit einem Kontingent (Quota) verwechselt, das die Gesamtnutzung über einen längeren Zeitraum wie einen Tag oder einen Monat begrenzt. Beide scheitern unterschiedlich: Ein Rate Limit löst sich innerhalb von Sekunden oder Minuten von selbst, ein aufgebrauchtes Kontingent bleibt aufgebraucht, bis es zurückgesetzt wird.
Rate Limit oder Kontingent: Finden Sie heraus, woran Sie gescheitert sind
Beides kommt als abgelehnte Anfrage an, und manche Anbieter liefern für beides denselben Statuscode, sodass der Fehler allein selten verrät, was es war. Klären Sie das, bevor Sie Code anfassen, denn die Lösungen zeigen in entgegengesetzte Richtungen.
- Ein Rate Limit zählt Anfragen pro kurzem Zeitfenster. Die Lösung heißt langsamer werden: Anfragen verteilen, in eine Warteschlange stellen und, wenn die Antwort einen Retry-After-Header enthält, so lange warten, bevor Sie es erneut versuchen.
- Ein Kontingent zählt die Gesamtnutzung — Anfragen, Credits, Nachrichten, Tokens — über einen Tag oder einen Monat. Ein paar Sekunden zu warten ändert nichts; die Optionen sind, auf das Zurücksetzen zu warten, das Limit zu erhöhen oder weniger zu verbrauchen.
- Ein Parallelitätslimit begrenzt, wie viele Anfragen gleichzeitig laufen dürfen, egal wie langsam sie eintreffen. Es greift, wenn Arbeit parallel verteilt wird, und lässt sich leicht mit einem Rate Limit verwechseln.
Prüfen Sie auch, wogegen das Limit gezählt wird: einen API-Schlüssel, ein Konto oder die Adresse, von der die Anfragen kommen. Davon hängt ab, ob ein zweiter Schlüssel überhaupt etwas ändern würde.
Ein Kontingent, das wir unbemerkt aufgebraucht haben
AgentCeres, der AI Growth Officer von agentceres.com, betreibt Agenten, die während ihrer Arbeit im Web suchen, und diese Suchen liefen über eine Such-API mit Schlüsseln aus dem kostenlosen Tarif mit 1.000 Credits pro Monat. Im September 2026 stellten wir fest, dass der Schlüssel, den die meisten unserer Agenten-Container teilten, bei 1.002 von 1.000 stand. Jede Websuche in diesen Workspaces war fehlgeschlagen, und nichts zeigte es an: Die Agenten riefen den Suchanbieter direkt auf, sodass dieser Datenverkehr durch nichts von uns lief, was ihn gezählt hätte.
Die Nutzungszahl täuschte auf eine Weise, die man sich merken sollte. Ein Zähler, der an seiner Obergrenze stehen bleibt, ist ein Mindestwert und keine Messung: Nachdem der Schlüssel aufgebraucht war, schlugen weitere Suchen fehl, statt gezählt zu werden, sodass die sichtbare Zahl die tatsächliche Nachfrage unterschätzte. Nachdem wir die Last auf Schlüssel mit freiem Kontingent verlagert hatten, kam ein ganzer Tag ungedeckelter Datenverkehr auf rund 153 Credits, etwa 4.600 im Monat — ungefähr das Vierfache der monatlichen Nutzung, die wir sehen konnten, solange der Schlüssel am Limit hing.
Die zweite Lektion kam beim Bau der Prüfung. Der Nutzungs-Endpunkt des Anbieters hat selbst ein Rate Limit, und dieses wird nach der Adresse gezählt, von der die Anfragen kommen, nicht nach dem Schlüssel: Sobald eine Prüfung es ausgelöst hatte, lieferten fünf verschiedene Schlüssel gemeinsam 429. Ein Skript, das es Schlüssel für Schlüssel erneut versucht, hätte das Loch nur tiefer gegraben. Unseres stoppt deshalb beim ersten 429, meldet, dass es keinen Wert erheben konnte, und wertet das als Fehler, nie als sauberes Ergebnis.
Für die Limits planen, auf die Sie stoßen werden
Gehen Sie davon aus, dass jeder Dienst, den Sie aufrufen, Sie irgendwann ablehnt, und legen Sie vorher fest, wie das für die Person aussieht, die Ihr Produkt nutzt. Eine Ablehnung, die als klare Meldung erscheint, kostet ein wenig Vertrauen. Eine Ablehnung, die als unauffällig schlechteres Ergebnis erscheint, kostet weit mehr, weil niemand weiß, dass es etwas zu beheben gibt. Warum hat meine App aufgehört, E-Mails zu versenden zeigt denselben Fehler bei einem E-Mail-Anbieter, bei dem die Ablehnung wie ein anderer Fehler aussah.
Drei Gewohnheiten decken das meiste ab. Warten Sie bei einem Rate Limit und versuchen Sie es erneut, unter Beachtung von Retry-After, aber wiederholen Sie niemals automatisch eine Aktion, die vielleicht schon stattgefunden hat, etwa eine Zahlung oder eine gesendete Nachricht. Erfassen Sie die Nutzung jedes abgerechneten Dienstes an einer Stelle, auf die Sie tatsächlich schauen, mit einer Warnung deutlich vor dem Limit und nicht erst beim Erreichen. Und behandeln Sie einen fehlenden Messwert als Alarm: Die Prüfung, die nicht laufen kann, ist die, die den Ausfall verbirgt.
FAQ
- Was bedeutet HTTP 429?
- Es ist der Statuscode Too Many Requests: Der Server teilt Ihnen mit, dass Sie in einem bestimmten Zeitraum zu viele Anfragen gesendet haben. Er ist in RFC 6585 definiert, und die Antwort kann einen Retry-After-Header enthalten, der angibt, wie lange Sie vor einem neuen Versuch warten sollen. Manche Anbieter senden ihn auch, wenn ein längerfristiges Kontingent aufgebraucht ist, lesen Sie also den Fehlertext, bevor Sie entscheiden, was es war.
- Was ist der Unterschied zwischen Rate Limit und Kontingent?
- Ein Rate Limit begrenzt Anfragen pro kurzem Zeitfenster und löst sich innerhalb von Sekunden oder Minuten von selbst. Ein Kontingent begrenzt die Gesamtnutzung über einen längeren Zeitraum, oft einen Monat, und bleibt aufgebraucht, bis es zurückgesetzt oder erhöht wird. Langsamer werden behebt das Erste und hilft beim Zweiten nicht.
- Kann man ein Rate Limit mit mehr API-Schlüsseln umgehen?
- Nur wenn das Limit pro Schlüssel gezählt wird, und nur wenn die Bedingungen des Anbieters es erlauben. Manche Limits werden pro Konto oder pro IP-Adresse gezählt, und dann ändert ein zweiter Schlüssel nichts — wir haben erlebt, wie fünf verschiedene Schlüssel gleichzeitig abgelehnt wurden, weil das Limit an der Adresse hing, von der die Prüfungen kamen.
- Wie gehen KI-Agenten mit Rate Limits um?
- So gut, wie jemand sie dafür ausgelegt hat. Ein Agent, der Tools in einer Schleife aufruft, kann ein Limit in Sekunden erreichen, und ein Modell kann ohne das fehlgeschlagene Tool weitermachen und trotzdem eine flüssige Antwort schreiben, die normal wirkt. Protokollieren Sie jeden abgelehnten Aufruf und sorgen Sie dafür, dass ein Tool-Fehler als Fehler gemeldet wird; Halluzination erklärt, was die Lücke füllen kann, wenn nicht.
- Wie vermeide ich es, an Rate Limits zu stoßen?
- Verteilen Sie Anfragen, statt sie stoßweise zu senden, cachen Sie Ergebnisse, die Sie sonst doppelt abrufen würden, bündeln Sie Aufrufe, wo die API es erlaubt, und stellen Sie Arbeit in eine Warteschlange, damit aus einer Spitze eine kurze Wartezeit wird und keine Wand von Ablehnungen. Beobachten Sie dann die Nutzung im Verhältnis zum Limit mit einer Warnung, die deutlich vorher auslöst, damit Sie von der Grenze aus einem Diagramm erfahren und nicht von einem Kunden.
An AI growth team that runs this for you
AgentCeres is a managed AI marketing team — you approve what ships. 14-day free trial, from $39/month.