- az-orchestrator: schlanker Router + Verifikator neu (Missionssatz- description, Routing-Tabelle mit Beispielfragen de/en/cs, Verifikations-Checkliste gegen Subagent-Output-Vertraege, Eskalationsregeln; glm-5-2 bleibt) - az-researcher: claude-sonnet-5, Web-vs-lokal-Klassifikation als Schritt 1, Output-Vertrag mit Failure-Bedingung, Exa-MCP-Tools explizit freigegeben (Websearch_web_search_exa/_fetch) und in der Arbeitsweise verankert - az-basecamp: duenne Shell ueber basecamp-Skill (Skill-Load als verpflichtender Schritt 1, Inline-CLI-Liste raus, Beleg-Pflicht) - az-office: Skill-Load nicht verhandelbar (Prometheus-Muster), L1/L2/L3 bleibt, Pruefbefund-Sektion, temp 0.1 - README: Trigger-Description praezisiert (Subagents=Beispielfragen, Primary=Missionssatz), Sprachregel-Variante gleichbedeutend, neue Standard-Regel Tool-/MCP-Freigabe (<Server>_<Tool> Namensschema) - tests/protocols/: Dogfooding- + Smoke-Test-Protokoll (az-pruefer gruen ueber alle 5 Agents, Routing 5/5, tschechisch -> tschechisch) Closes beads: az-agent-defaults-h2j, -99v, -bfj, -m4t, -jtp
3.2 KiB
Smoke-Test-Protokoll: perfektionierte Agents (2026-09-20)
Beleg zu beads az-agent-defaults-jtp (Dogfooding + Smoke-Tests) nach den
Rewrites aus 74g, h2j, 99v, bfj, m4t. Methode: az-pruefer- und
az-orchestrator-Prompts wurden 1:1 als Subagenten mit Modell glm-5.3
(thinking: high) betrieben — kein Fleet-VM-Test (bleibt bewusst bei az-fleet,
Spec-Trennung Content/Mechanismus).
1. Dogfooding: az-pruefer über alle 5 Agenten (agents/*.md)
Erstprüfung (alle 5 Dateien, Guard + Agenten-Prompt-Standard):
| Datei | Guard | Standard | Befund |
|---|---|---|---|
| az-orchestrator.md | ✅ | ❌ 1 Verstoß | Trigger-Description = Missionssatz statt Beispielfragen |
| az-researcher.md | ✅ | ✅ | — |
| az-basecamp.md | ✅ | ✅ | — |
| az-office.md | ✅ | ✅ | Kosmetik: Anführungszeichen |
| az-pruefer.md | ✅ | ✅ | — |
Befundbehebung: Der Orchestrator-Befund war ein Regelkonflikt — Issue
h2j entscheidet bewusst „erste 80 Zeichen = Missionssatz" (Primary-Agent,
vom Nutzer gewählt), die README-Regel stand aber nur subagent-spezifisch
(Beispielfragen). Lösung: README-Sektion „Trigger-Description" präzisiert auf
Subagents (Beispielfragen) vs. Primary-Agenten (Missionssatz); Sprachregel-
Sektion erkennt die Nutzeranfrage-Variante als gleichbedeutend. Zusätzlich
Grammar-Fix in az-office („bearbeite sie ausschließlich").
Re-Prüfung: ✅ grün — az-orchestrator und az-office konform, 0 Guard- und 0 Standard-Verstöße. Zeichenwerte (Body): orchestrator ~7.000, researcher ~2.900, basecamp ~2.500, office ~2.300, pruefer ~3.200 — alle < 10.000.
2. Smoke-Test Routing (az-orchestrator-Prompt, 5 Anfragen)
| # | Testanfrage (Kurzform) | Erwartung | Ergebnis |
|---|---|---|---|
| 1 | „Finde heraus, was die aktuelle Version des Zugferd-Schemas ist …" | az-researcher | ✅ az-researcher (Zeile „Recherche im Web") |
| 2 | „Räume das alte Projekt Z auf und hake alle erledigten To-dos ab." | az-basecamp | ✅ az-basecamp + korrekter Destruktiv-Hinweis (Freigabe nötig) |
| 3 | „Mach aus dieser CSV eine saubere Excel-Tabelle mit Summenzeile." | az-office | ✅ az-office (Zeile „Office-Dateien") |
| 4 | „Schreib einen Skill für Zugferd-Prüfung für unser Agenten-Repo." | Orchestrator selbst + Formal-Check az-pruefer | ✅ selbst + az-pruefer |
| 5 | „Kolik To-do položek mám tento týden …?" (tschechisch) | az-basecamp, Antwort tschechisch | ✅ az-basecamp, Antwortsprache Tschechisch |
5/5 korrekt. Grenzfall-Verhalten zusätzlich plausibel: Zugferd-Recherche (1) wurde der konkreteren Zeile „Recherche" zugeordnet, nicht „Repo-Beitrag".
3. Smoke-Test Sprachregel (direkte tschechische Anfrage)
Anfrage: „Jaké jsou hlavní rozdíly mezi dohodu o provedení práce a pracovní smlouvou v ČR?" — Ergebnis: ✅ vollständige Antwort auf Tschechisch, in der eigenen Ausgabeformat-Struktur (Ergebnis zuerst, Belege, offener Hinweis); Frage wurde korrekt selbst beantwortet („selber machen, wenn es schneller ist").
Ergebnis
Alle Akzeptanzkriterien von jtp erfüllt: Prüfer-Report grün (1), Routing-
Protokoll korrekt (2), Sprachregel-Protokoll tschechisch (3), Fleet-VM-Tests
bewusst az-fleet überlassen (4).