Cron-Jobs für KI-Agenten und LLM-Pipelines

Führen Sie Agenten, Batch-Inferenz und Embedding-Aktualisierungen nach Zeitplan aus — und erfahren Sie innerhalb von Minuten, wenn ein Lauf scheitert, an einem hängenden API-Aufruf festhängt oder stillschweigend nichts produziert.

Das Problem

KI-Workloads wandern auf Zeitpläne — ein nächtlicher Agent, der einen Digest erstellt, eine stündliche Embedding-Aktualisierung, Batch-Klassifizierung über die Tickets von gestern. Sie erben jeden klassischen Cron-Fehler und bringen eigene mit: Rate-Limits, hängende LLM-Aufrufe ohne Timeout, eine Modell-ID, die ein Provider-Update abgekündigt hat, eine Agenten-Schleife, die einen Tool-Fehler verschluckt und mit Exit-Code 0 endet, ohne etwas getan zu haben. Und niemand schaut auf die Ausgabe — unbeaufsichtigt zu laufen war ja der ganze Zweck.

So löst SteadyCron das

  1. 1 Starten Sie den Workload mit einem HTTP-Job — SteadyCron ruft Ihren Endpoint nach Zeitplan auf, mit Wiederholungen, Backoff und Timeout — oder behalten Sie Ihr bestehendes Cron und ergänzen Sie einen Heartbeat.
  2. 2 Pingen Sie /start beim Beginn des Laufs und /success beim Abschluss, damit ein an einem hängenden LLM-Aufruf festhängender Lauf als überfällig erscheint statt als Stille.
  3. 3 Fügen Sie eine kurze Nutzlast hinzu — verarbeitete Elemente, Token-Verbrauch, verwendetes Modell — als Kontext im Aktivitäts-Feed.
  4. 4 Alarmieren Sie bei verpassten, fehlgeschlagenen oder überlangen Läufen, mit Schwellenwerten für aufeinanderfolgende Fehler, damit ein einzelner Rate-Limit-Aussetzer niemanden aufweckt.
TOKEN=<ihr-ping-token>
curl -fsS https://ping.steadycron.com/$TOKEN/start
n=$(python run_agent.py --task nightly-digest) \
  && curl -fsS --data "processed=$n" https://ping.steadycron.com/$TOKEN \
  || curl -fsS https://ping.steadycron.com/$TOKEN/fail
app.steadycron.com/jobs

Jobs

New job
Search jobs…
All HTTP Heartbeat
Status Group: env
env:prod 5 jobs 1 failing
weekly-digest-email HTTP 0 9 * * 1 in 2 days 3 days ago
nightly-db-backup Heartbeat 0 2 * * * in 19 h 5 h ago
stripe-reconciliation HTTP 0 */4 * * * in 38 min 3 h ago
cache-warmup HTTP */15 * * * * in 11 min now
search-index-sync Heartbeat */30 * * * * in 6 min 24 min ago
env:dev 3 jobs
seed-test-data HTTP 0 4 * * * in 14 h 10 h ago
preview-env-cleanup Heartbeat 0 */6 * * * in 2 h 4 h ago
trial-expiry-sweep HTTP 0 6 * * * yesterday

Status, Zeitplan und letzter Lauf jedes Jobs — auf einen Blick.

Exit-Code 0 ist kein Ergebnis

Agenten-Frameworks sind darauf gebaut weiterzumachen: Ein Tool-Aufruf scheitert, das Modell entschuldigt sich und fährt fort, und der Prozess endet sauber, ohne etwas geschrieben zu haben. Pingen Sie Erfolg nicht, weil der Prozess geendet hat — pingen Sie erst, nachdem Sie geprüft haben, dass das Ergebnis existiert (der Digest wurde verschickt, die Zeilen wurden eingebettet, die Ausgabedatei ist nicht leer), und pingen Sie /fail selbst, wenn es fehlt. Der Heartbeat-Check alarmiert dann bei dem, was wirklich zählt: kein gültiges Ergebnis im erwarteten Zeitfenster, egal aus welchem Grund.

Fehlerarten, die reines Cron nie hatte

  • Rate-Limits und Ausgabenlimits: Ein 429-Sturm oder ein erschöpftes Monatsbudget beendet den heutigen Lauf vorzeitig — und den morgigen auch. Schwellenwerte für aufeinanderfolgende Fehler trennen den kurzen Aussetzer von der Pipeline, die kaputt bleibt.
  • Hängende Aufrufe: Ein LLM-Request ohne Timeout kann einen Lauf für immer festhalten. Weil /start ankam und /success nie, erscheint der Lauf nach der Kulanzzeit als überfällig — statt tagelang unbemerkt zu hängen.
  • Modell-Drift: Eine abgekündigte Modell-ID oder ein geändertes Antwortformat bricht Ihr Parsing nach dem Zeitplan des Providers, nicht nach Ihrem Deploy-Zeitplan. Das Protokoll pro Lauf — Status, Nutzlast, Dauer — zeigt genau, in welcher Nacht es begann.

Gut geeignet für

  • Nächtliche Agenten-Läufe: Digests, Ticket-Triage, Berichtserstellung, geplante Scrapes, die ein Modell füttern.
  • RAG-Wartung: Embedding-Aktualisierungen und Index-Rebuilds, deren Veralten unsichtbar bleibt, bis die Antwortqualität nachlässt.
  • Batch-Inferenz: Klassifizierungs-, Anreicherungs- oder Zusammenfassungs-Jobs über die Daten von gestern.

Sie debuggen gerade einen Lauf, der bereits verstummt ist? Siehe Geplanter KI-Agent läuft nicht für eine schrittweise Diagnose, oder Totmannschalter für KI-Agenten für das Muster dahinter.

Verwandte Dokumentation

Erfahren Sie es nicht erst im Ernstfall

Starten Sie mit dem kostenlosen Tarif — keine Kreditkarte erforderlich.

Kostenlos starten