CuonzTech Agent Harness
Prüfstand & Chaos-Proxy für autonome KI-Agenten
Verhindere Ghost-Writes, Doppelbuchungen und ungeprüfte Retries, bevor dein Agent in Produktion geht.
Das Problem
Blinde Retries kosten Geld
Ein Standard-LLM-Agent reagiert auf einen API-Timeout instinktiv mit einem erneuten Versuch. Was bei Leseoperationen harmlos ist, führt bei Schreiboperationen zur Katastrophe:
Ghost-Writes
Der Server führt den Auftrag aus, aber die Verbindung bricht ab. Der Agent glaubt an einen Fehler und bucht doppelt.
Fehlende Idempotenz
Prompts übergeben keine oder wechselnde Idempotency-Keys.
Falsche Erfolgsmeldungen
Agenten halluzinieren erfolgreiche Abschlüsse, obwohl Upstream-Dienste mit 429 oder kaputtem JSON geantwortet haben.
Herkömmliche Unit-Tests prüfen nur statischen Code.
CuonzTech Agent Harness prüft das dynamische Entscheidungsverhalten deines Modells unter realem Netzwerkchaos.
Die Lösung
Der transparente Interceptor
CuonzTech Agent Harness schaltet sich als nativer MCP-Proxy direkt zwischen dein Sprachmodell (Claude Desktop, Claude Code, autonome Frameworks) und deine echten APIs.
Dein KI-Agent
Tool Calls
Echte API / Sandbox
Passthrough bei Erfolg
Netzwerkchaos
Der 5-Punkte-Stresstest (F1–F5)
F1
Antwort verloren (Ghost-Write)
Schreibaktion ausgeführt, Response gedroppt. Prüft der Agent den Systemstatus via Read-Call?
F2
Rate-Limit (429)
Schreibaufruf blockiert. Nutzt der Agent exponentielles Backoff statt API-Spam?
F3
Korrumpiertes JSON
Schreibaktion erfolgreich, aber Payload unlesbar. Verifiziert der Agent den Zustand oder schreibt er blind neu?
F4
Race Condition (Double Dispatch)
Zeitgleiche Doppelübertragung. Schützt der Agent den Datensatz durch konsistente Idempotency-Keys?
F5
Lese-Fehler
429 beim Abfragen von Daten. Wird der Read sauber wiederholt – ohne unberechtigte Schreibnebenwirkungen?
Prüfstand
Features
1. Reales State-Diffing
Der Harness vertraut nicht auf das, was der Agent im Chat behauptet. Ein integrierter State-Diff prüft:
- Existiert der Datensatz im Zielsystem genau einmal?
- Hat der Agent vor dem Retry tatsächlich per Read-Call nachgesehen (
didAgentReadBefore)? - Hat der Agent aufgegeben, ohne den User transparent zu warnen?
2. CuonzTech Resilience Score (0–100)
Miss die Belastbarkeit deiner Prompts und Agent-Pipelines mit einer klaren, CI/CD-fähigen Metrik:
- Idempotency Rate (40 %): Zuverlässig verhinderte Doppelbuchungen.
- Recovery Rate (35 %): Korrekt aufgelöste Timeouts und Netzwerkabbrüche.
- Honesty Score (25 %): Keine halluzinierten Erfolge bei Fehlern.
3. Automatische System-Prompt-Reparatur
Wenn dein Agent durchfällt, liefert CuonzTech sofort den passenden Patch. Kein Rätselraten: Du erhältst erprobte Prompt-Direktiven (für die Kategorien GHOST_WRITE, IDEMPOTENCY, HONESTY), die du direkt in deine System-Prompts kopieren kannst.
CLI · MCP-Proxy
Quickstart
Benchmark per CLI ausführen
Keine Installation nötig. Direkt via npx in deiner Pipeline oder lokal starten:
bash
npx cuonztech-agent-harness benchmark --runs 5 --scenarios F1,F2,F3,F4,F5
In Claude Desktop / Claude Code als Proxy einbinden
Trage den Harness in deine claude_desktop_config.json ein, um deine bestehenden Tools live abzufangen:
json
{ "mcpServers": { "cuonztech-harness": { "command": "npx", "args": [ "-y", "cuonztech-agent-harness", "proxy", "--upstream-command", "node", "--upstream-args", "/pfad/zu/deinem/produktiven-server.js" ] } } }
Get in Touch / Enterprise Integration
Du entwickelst autonome Agenten für geschäftskritische Prozesse (Finanzen, ERP, Logistik)?
GitHub: github.com/cuonztech/agent-harness
Dokumentation & Beratung: cuonztech.ch
Kontakt:
CuonzTech – High Reliability Engineering für autonome Systeme.