Files
az-agent-defaults/tests/protocols/2026-09-20-smoke-test-agents.md
T
m3ta-chiron 77d81be718 feat: agents nach prompt-standard perfektionieren + exa-freigabe + dogfooding
- az-orchestrator: schlanker Router + Verifikator neu (Missionssatz-
  description, Routing-Tabelle mit Beispielfragen de/en/cs,
  Verifikations-Checkliste gegen Subagent-Output-Vertraege,
  Eskalationsregeln; glm-5-2 bleibt)
- az-researcher: claude-sonnet-5, Web-vs-lokal-Klassifikation als
  Schritt 1, Output-Vertrag mit Failure-Bedingung, Exa-MCP-Tools
  explizit freigegeben (Websearch_web_search_exa/_fetch) und in der
  Arbeitsweise verankert
- az-basecamp: duenne Shell ueber basecamp-Skill (Skill-Load als
  verpflichtender Schritt 1, Inline-CLI-Liste raus, Beleg-Pflicht)
- az-office: Skill-Load nicht verhandelbar (Prometheus-Muster),
  L1/L2/L3 bleibt, Pruefbefund-Sektion, temp 0.1
- README: Trigger-Description praezisiert (Subagents=Beispielfragen,
  Primary=Missionssatz), Sprachregel-Variante gleichbedeutend, neue
  Standard-Regel Tool-/MCP-Freigabe (<Server>_<Tool> Namensschema)
- tests/protocols/: Dogfooding- + Smoke-Test-Protokoll (az-pruefer
  gruen ueber alle 5 Agents, Routing 5/5, tschechisch -> tschechisch)

Closes beads: az-agent-defaults-h2j, -99v, -bfj, -m4t, -jtp
2026-09-20 20:30:02 +02:00

3.2 KiB

Smoke-Test-Protokoll: perfektionierte Agents (2026-09-20)

Beleg zu beads az-agent-defaults-jtp (Dogfooding + Smoke-Tests) nach den Rewrites aus 74g, h2j, 99v, bfj, m4t. Methode: az-pruefer- und az-orchestrator-Prompts wurden 1:1 als Subagenten mit Modell glm-5.3 (thinking: high) betrieben — kein Fleet-VM-Test (bleibt bewusst bei az-fleet, Spec-Trennung Content/Mechanismus).

1. Dogfooding: az-pruefer über alle 5 Agenten (agents/*.md)

Erstprüfung (alle 5 Dateien, Guard + Agenten-Prompt-Standard):

Datei Guard Standard Befund
az-orchestrator.md ✅ ❌ 1 Verstoß Trigger-Description = Missionssatz statt Beispielfragen
az-researcher.md ✅ ✅ —
az-basecamp.md ✅ ✅ —
az-office.md ✅ ✅ Kosmetik: Anführungszeichen
az-pruefer.md ✅ ✅ —

Befundbehebung: Der Orchestrator-Befund war ein Regelkonflikt — Issue h2j entscheidet bewusst „erste 80 Zeichen = Missionssatz" (Primary-Agent, vom Nutzer gewählt), die README-Regel stand aber nur subagent-spezifisch (Beispielfragen). Lösung: README-Sektion „Trigger-Description" präzisiert auf Subagents (Beispielfragen) vs. Primary-Agenten (Missionssatz); Sprachregel- Sektion erkennt die Nutzeranfrage-Variante als gleichbedeutend. Zusätzlich Grammar-Fix in az-office („bearbeite sie ausschließlich").

Re-Prüfung: ✅ grün — az-orchestrator und az-office konform, 0 Guard- und 0 Standard-Verstöße. Zeichenwerte (Body): orchestrator ~7.000, researcher ~2.900, basecamp ~2.500, office ~2.300, pruefer ~3.200 — alle < 10.000.

2. Smoke-Test Routing (az-orchestrator-Prompt, 5 Anfragen)

# Testanfrage (Kurzform) Erwartung Ergebnis
1 „Finde heraus, was die aktuelle Version des Zugferd-Schemas ist …" az-researcher ✅ az-researcher (Zeile „Recherche im Web")
2 „Räume das alte Projekt Z auf und hake alle erledigten To-dos ab." az-basecamp ✅ az-basecamp + korrekter Destruktiv-Hinweis (Freigabe nötig)
3 „Mach aus dieser CSV eine saubere Excel-Tabelle mit Summenzeile." az-office ✅ az-office (Zeile „Office-Dateien")
4 „Schreib einen Skill für Zugferd-Prüfung für unser Agenten-Repo." Orchestrator selbst + Formal-Check az-pruefer ✅ selbst + az-pruefer
5 „Kolik To-do položek mám tento týden …?" (tschechisch) az-basecamp, Antwort tschechisch ✅ az-basecamp, Antwortsprache Tschechisch

5/5 korrekt. Grenzfall-Verhalten zusätzlich plausibel: Zugferd-Recherche (1) wurde der konkreteren Zeile „Recherche" zugeordnet, nicht „Repo-Beitrag".

3. Smoke-Test Sprachregel (direkte tschechische Anfrage)

Anfrage: „Jaké jsou hlavní rozdíly mezi dohodu o provedení práce a pracovní smlouvou v ČR?" — Ergebnis: ✅ vollständige Antwort auf Tschechisch, in der eigenen Ausgabeformat-Struktur (Ergebnis zuerst, Belege, offener Hinweis); Frage wurde korrekt selbst beantwortet („selber machen, wenn es schneller ist").

Ergebnis

Alle Akzeptanzkriterien von jtp erfüllt: Prüfer-Report grün (1), Routing- Protokoll korrekt (2), Sprachregel-Protokoll tschechisch (3), Fleet-VM-Tests bewusst az-fleet überlassen (4).