Files
az-agent-defaults/tests/protocols/2026-09-20-smoke-test-agents.md
T
m3ta-chiron 77d81be718 feat: agents nach prompt-standard perfektionieren + exa-freigabe + dogfooding
- az-orchestrator: schlanker Router + Verifikator neu (Missionssatz-
  description, Routing-Tabelle mit Beispielfragen de/en/cs,
  Verifikations-Checkliste gegen Subagent-Output-Vertraege,
  Eskalationsregeln; glm-5-2 bleibt)
- az-researcher: claude-sonnet-5, Web-vs-lokal-Klassifikation als
  Schritt 1, Output-Vertrag mit Failure-Bedingung, Exa-MCP-Tools
  explizit freigegeben (Websearch_web_search_exa/_fetch) und in der
  Arbeitsweise verankert
- az-basecamp: duenne Shell ueber basecamp-Skill (Skill-Load als
  verpflichtender Schritt 1, Inline-CLI-Liste raus, Beleg-Pflicht)
- az-office: Skill-Load nicht verhandelbar (Prometheus-Muster),
  L1/L2/L3 bleibt, Pruefbefund-Sektion, temp 0.1
- README: Trigger-Description praezisiert (Subagents=Beispielfragen,
  Primary=Missionssatz), Sprachregel-Variante gleichbedeutend, neue
  Standard-Regel Tool-/MCP-Freigabe (<Server>_<Tool> Namensschema)
- tests/protocols/: Dogfooding- + Smoke-Test-Protokoll (az-pruefer
  gruen ueber alle 5 Agents, Routing 5/5, tschechisch -> tschechisch)

Closes beads: az-agent-defaults-h2j, -99v, -bfj, -m4t, -jtp
2026-09-20 20:30:02 +02:00

59 lines
3.2 KiB
Markdown

# Smoke-Test-Protokoll: perfektionierte Agents (2026-09-20)
Beleg zu beads `az-agent-defaults-jtp` (Dogfooding + Smoke-Tests) nach den
Rewrites aus `74g`, `h2j`, `99v`, `bfj`, `m4t`. Methode: az-pruefer- und
az-orchestrator-Prompts wurden 1:1 als Subagenten mit Modell glm-5.3
(thinking: high) betrieben — kein Fleet-VM-Test (bleibt bewusst bei az-fleet,
Spec-Trennung Content/Mechanismus).
## 1. Dogfooding: az-pruefer über alle 5 Agenten (`agents/*.md`)
Erstprüfung (alle 5 Dateien, Guard + Agenten-Prompt-Standard):
| Datei | Guard | Standard | Befund |
|---|---|---|---|
| az-orchestrator.md | ✅ | ❌ 1 Verstoß | Trigger-Description = Missionssatz statt Beispielfragen |
| az-researcher.md | ✅ | ✅ | — |
| az-basecamp.md | ✅ | ✅ | — |
| az-office.md | ✅ | ✅ | Kosmetik: Anführungszeichen |
| az-pruefer.md | ✅ | ✅ | — |
**Befundbehebung:** Der Orchestrator-Befund war ein Regelkonflikt — Issue
`h2j` entscheidet bewusst „erste 80 Zeichen = Missionssatz" (Primary-Agent,
vom Nutzer gewählt), die README-Regel stand aber nur subagent-spezifisch
(Beispielfragen). Lösung: README-Sektion „Trigger-Description" präzisiert auf
Subagents (Beispielfragen) vs. Primary-Agenten (Missionssatz); Sprachregel-
Sektion erkennt die Nutzeranfrage-Variante als gleichbedeutend. Zusätzlich
Grammar-Fix in az-office („bearbeite sie ausschließlich").
**Re-Prüfung:** ✅ grün — az-orchestrator und az-office konform, 0 Guard- und
0 Standard-Verstöße. Zeichenwerte (Body): orchestrator ~7.000, researcher
~2.900, basecamp ~2.500, office ~2.300, pruefer ~3.200 — alle < 10.000.
## 2. Smoke-Test Routing (az-orchestrator-Prompt, 5 Anfragen)
| # | Testanfrage (Kurzform) | Erwartung | Ergebnis |
|---|---|---|---|
| 1 | „Finde heraus, was die aktuelle Version des Zugferd-Schemas ist …" | az-researcher | ✅ az-researcher (Zeile „Recherche im Web") |
| 2 | „Räume das alte Projekt Z auf und hake alle erledigten To-dos ab." | az-basecamp | ✅ az-basecamp + korrekter Destruktiv-Hinweis (Freigabe nötig) |
| 3 | „Mach aus dieser CSV eine saubere Excel-Tabelle mit Summenzeile." | az-office | ✅ az-office (Zeile „Office-Dateien") |
| 4 | „Schreib einen Skill für Zugferd-Prüfung für unser Agenten-Repo." | Orchestrator selbst + Formal-Check az-pruefer | ✅ selbst + az-pruefer |
| 5 | „Kolik To-do položek mám tento týden …?" (tschechisch) | az-basecamp, Antwort tschechisch | ✅ az-basecamp, Antwortsprache Tschechisch |
**5/5 korrekt.** Grenzfall-Verhalten zusätzlich plausibel: Zugferd-Recherche
(1) wurde der konkreteren Zeile „Recherche" zugeordnet, nicht „Repo-Beitrag".
## 3. Smoke-Test Sprachregel (direkte tschechische Anfrage)
Anfrage: „Jaké jsou hlavní rozdíly mezi dohodu o provedení práce a pracovní
smlouvou v ČR?" — Ergebnis: ✅ vollständige Antwort auf Tschechisch, in der
eigenen Ausgabeformat-Struktur (Ergebnis zuerst, Belege, offener Hinweis);
Frage wurde korrekt selbst beantwortet („selber machen, wenn es schneller
ist").
## Ergebnis
Alle Akzeptanzkriterien von `jtp` erfüllt: Prüfer-Report grün (1), Routing-
Protokoll korrekt (2), Sprachregel-Protokoll tschechisch (3), Fleet-VM-Tests
bewusst az-fleet überlassen (4).