Beiträge zu "operations"
-
Rückblick Betriebsreihe: Agentenplattformen unterscheiden sich kaum vom klassischen Betrieb
Betrieb von KI-Plattformen im Rückblick: Tabelle von zwölf Disziplinen, was aus DevOps und SRE übernommen wird und was bei Agenten wirklich neu ist.
-
Betriebsreihe: Kapazität, Rate Limits und außer Kontrolle geratene Agenten
LLM Rate Limiting für Agenten: verschachtelte Limits für Lauf, Agent, Mandant und Anbieter verhindern, dass eine Schleife alle ausbremst. Mit Beispiel.
-
Betriebsreihe: KI-Agenten ausrollen mit Canaries und Rollbacks
KI-Agenten ausrollen wie jeden Dienst: neues Modell, Prompt oder Skill zuerst an wenige Läufe, Evals und SLOs entscheiden, ein Rollback bleibt bereit.
-
Betriebsreihe: LLM FinOps für Agenten, jedes Token zuordnen
LLM FinOps überträgt das Cloud-Vorgehen auf Agenten: Läufe taggen, Kosten je Key und Team zuordnen, Budgets setzen, früh warnen, Nutzung exportieren.
-
Betriebsreihe: Audit-Trails sind keine Logs
Ein AI audit trail muss vollständig, zurechenbar und manipulationssicher erkennbar sein; Logs dienen der Fehlersuche. Wie man sie trennt und was wohin gehört.
-
Selbst betriebene Modelle für Agenten: was sich ändert, wenn die Inferenz bei dir läuft
Self-hosted LLM für Agenten: Prompts bleiben im Haus, Sie tragen aber Kapazität, Updates und Bewertung. Lokale Runtimes, Batch-Server und der Betriebsaufwand.
-
Betriebsreihe: Runbooks zu Skills machen, ohne die Kontrolle zu verlieren
Runbook automation AI mit Kontrolle: Runbook in einen Skill plus eng begrenzte Tools mit Freigaben umwandeln. Eine Schritt-für-Schritt-Anleitung für Ops-Teams.
-
Betriebsreihe: AI Supply Chain Security und Patchen für Agenten
AI Supply Chain Security für Agenten: Modelle, MCP-Server, Skills, SDKs und Images inventarisieren und patchen. Checkliste für gepinnte, geprüfte Artefakte.
-
Betriebsreihe: AI Incident Response, wenn ein Agent der Akteur ist
AI Incident Response behält die Phasen, braucht aber Kill Switch, Tool-Entzug und Policy-Freeze in Sekunden. Playbook und Postmortem für Agenten-Vorfälle.
-
Betriebsreihe: SLOs für Agenten, von Aufgabenerfolg bis Zeit bis zur Freigabe
Ein SLO für AI agents wird wie für jeden Dienst definiert: Aufgabenerfolg, Konsistenz, Latenz, Kosten pro Aufgabe und ein Error Budget als Rollout-Steuerung.
-
Betriebsreihe: Observability für Agenten mit Traces statt Transkripten
AI agent observability gelingt als verteiltes Tracing: Modell- und Tool-Aufrufe werden zu Spans mit Tokens, Kosten, Entscheidungen. Mit OpenTelemetry.
-
Betriebsreihe: Change-Management und Prompt-Versionierung für Agenten
Prompt-Versionierung und Change-Management für KI-Agenten: Prompts, Skills und Policies wie Code behandeln, mit SemVer, Review und Rollback.
-
Betriebsreihe: Geheimnisse gehören nie in das Kontextfenster eines Agenten
Secrets Management für KI-Agenten in der Praxis: Zugangsdaten bleiben auf der Tool-Seite, das Modell sieht nur Handles, Token-Passthrough entfällt.
-
Betriebsreihe: Identität für Agenten, oder wer handelt in wessen Auftrag
KI-Agenten-Identität: Jeder Agent braucht eine eigene Identität und den Vermerk, für wen er handelt. Delegation statt Impersonation, zielgebundene Tokens.
-
Agenten betreiben ist Betrieb: die alten Disziplinen gelten weiter
KI-Agenten betreiben ist kein neues Fach: Identität, minimale Rechte, Change-Management, SLOs, Kosten und Audit gelten weiter. Auftakt einer Betriebsreihe.