ai-assist Benutzerhandbuch

Testen

Der Reiter Testen verbindet manuellen Live-Chat, Debug-Spalte, Testfall-Recorder, automatische Regression, QS-Startberatung und AFS-Split-Screen-Prüfung.

Was Sie hier erledigen

Testen-Maske in der manuellen Sicht mit Chat, Eingabefeld, Recorder und Debugspalte 1 2 3 4 5
Abb. T-01: Manueller Testchat mit Recorder und Debugspalte.
MarkerElementBedeutung
1ManuellDirekter Test einer Chat-Session in der Admin-Oberfläche.
2ChatverlaufZeigt Assistenten- und Benutzernachrichten.
3EingabeSendet Testnachrichten an den Chat.
4Recorder, Export und JudgeZeichnet Testfälle auf, kopiert oder speichert den Chat, bewertet die aktuelle Antwort mit dem Judge oder startet neu.
5DebugspalteZeigt Ablauf, Schritt, Sprache und ausgewählten Service.

Abb. T-01 zeigt die manuelle Testansicht vor der Erklärung der Testaufgaben. Der Chat links nutzt eine echte Session, die Debugspalte rechts zeigt Ablauf, Sprache und Serviceauswahl.

Sicht Manuell

Die Judge-Bewertung ist verfügbar, wenn eine aktive Testsession mindestens eine Nutzerfrage mit nachfolgender Bot-Antwort enthält und die angemeldete Person die Leserechte für Chat-Tests, Debug, Services und Wissen besitzt. Das Overlay enthält keine manuelle Service- oder Antwortauswahl; es startet automatisch und zeigt Judge prüft ..., bis ein Ergebnis oder ein nicht bewertbarer Zustand vorliegt.

Bewertbar sind deutschsprachige Testdialoge mit ausreichendem Service-, Frage- und Wissenskartenkontext. Fehlt dieser Kontext, ändert ai-assist keine Daten, sondern meldet, dass keine belastbare Bewertung möglich ist.

Beispiel: Testfall aus einem Dialog erzeugen

Starten Sie die Aufzeichnung, stellen Sie ein Bürger:innenanliegen, bestätigen Sie den richtigen Service und beantworten Sie die wichtigsten Rückfragen. Beim Stoppen der Aufzeichnung zeigt ai-assist eine Vorschau der erkannten Schritte. Prüfen Sie dort, ob die vorgeschlagenen Prüfungen sinnvoll sind, bevor Sie den Testfall speichern.

Beispiel: Wissenslücke aus dem Testchat prüfen

Stellen Sie im manuellen Testchat eine freie Fachfrage. Wenn die Antwort fehlt, zu grob ist oder nicht zum erwarteten Detail passt, öffnen Sie Aktuelle Antwort mit Judge bewerten. Prüfen Sie Begründung, Coverage und angezeigte Wissenskarten. Springen Sie über den Kartenpfeil in Fakten > Wissen, wenn eine Quelle oder Wissenskarte ergänzt oder präzisiert werden muss.

Sicht QS-Service & Assistenz

Testen-Maske in der Sicht QS-Service und Assistenz mit Testfallliste, Suche und Ausführungsbereich 1 2 3 4
Abb. T-02: QS-Service & Assistenz mit Suche und Laufsteuerung.
MarkerElementBedeutung
1QS-Service & AssistenzWechselt zur Verwaltung gespeicherter Dialog- und AFS-Testfälle.
2TestfalllisteSucht, filtert, wählt und markiert gespeicherte Dialogtests.
3Testfall/TestlaufTrennt gespeicherte Erwartung von tatsächlichem Laufprotokoll.
4Ausführen und VerwaltenStartet Tests, steuert Sichtprüfung oder speichert den Inspector.

Abb. T-02 steht vor der Beschreibung der Sicht QS-Service & Assistenz. Links werden Testfälle gesucht und ausgewählt, rechts werden Erwartung, Testlauf und Ergebnisse kontrolliert.

Beispiel: Testlauf-Fehlerartefakt JSON

{
  "artifact_id": "autt-failure-wohnbeihilfe-001",
  "artifact_filename": "autt-failure-wohnbeihilfe-001.json",
  "screenshot_selector": "#afsPreviewFrame",
  "frame_selector": "#afsPreviewFrame",
  "preview_proxy_url": "/admin/afs-preview/..."
}

Dieses JSON ist ein technisches Analysepaket für fehlgeschlagene Testläufe. Es wird nicht importiert und ersetzt keinen gespeicherten Testfall.

1 Testfall prüfen Im Tab Testfall Schritte, Prüfungen und Erwartungswerte bearbeiten.
2 Testlauf starten Ausgewählte Fälle abspielen; Sichtprüfung nur bei gezielter optischer Kontrolle aktivieren.
3 Ergebnis bewerten Fehler im Testlauf lesen, Testfall oder Fachinhalt korrigieren.

Beispiel: stabile Erwartung wählen

Wenn die Antwortformulierung schwankt, ist Antwort ok plus Service oder State meist robuster als ein langer exakter Textvergleich. Für AFS-Schritte ergänzen Sie AFS-Felder, damit nicht nur die Chatantwort, sondern auch die Formularmarkierung geprüft wird.

QS-Startberatung

Die Ansicht QS-Startberatung prüft, ob die freie Startberatung passende Antworten aus den Wissenskarten liefert und ob die Bewertung durch den Judge nachvollziehbar ist. Links steht die Serviceauswahl, rechts die Auswertung der Testfragen.

Testen-Maske in der Sicht QS-Startberatung mit Serviceliste, Testfragen, Bewertungen und Aktionen 1 2 3 4 5 6
Abb. T-03: QS-Startberatung mit Serviceauswahl, Fragen und Bewertungen.
MarkerElementBedeutung
1QS-StartberatungWechselt zur Qualitätssicherung der freien Startberatung.
2ServicefilterSucht Services und filtert bei Bedarf auf offene QS-Ergebnisse.
3ServicekarteZeigt Fragenset, Freigabestatus und Durchschnittsbewertung.
4TestfragenZeigt die Fragenansicht des ausgewählten Services.
5Fragen und BewertungenZeigt Antwortvorschau, Judge-Score und Detailzugang je Frage.
6Import, Export und PflegeImportiert CSV, exportiert Fragen, legt Fragen an oder löscht markierte Fragen.

CSV-Import und -Export für Fragen

Der Fragenexport verwendet Komma als Trennzeichen und ist als Importvorlage geeignet. Der Import akzeptiert zusätzlich Semikolon- und Tab-getrennte Dateien. Zulässige Werte für split sind training, validation und holdout; ohne Wert wird training verwendet. test_goal akzeptiert routing, knowledge_answer, boundary, no_answer oder mixed. expected_answer_mode akzeptiert answerable, no_answer, boundary_answer oder unknown. Das Gewicht weight ist eine positive Zahl; bei Komma-CSV verwenden Sie am besten Dezimalpunkte oder setzen Dezimalkommas in Anführungszeichen.

Beispiel: reimportierbare CSV

frage,service_slug,split,test_goal,expected_answer_mode,weight
Welche Nachweise brauche ich?,wohnbeihilfe,training,knowledge_answer,answerable,1
Wann muss ich den Antrag stellen?,wohnbeihilfe,validation,boundary,boundary_answer,1.5

Beispiel: einfache Datei ohne Kopfzeile

Welche Unterlagen brauche ich?
Gibt es eine Frist?
Muss ich den Antrag neu stellen, wenn sich mein Einkommen ändert?;
X Darf ich den Antrag rückwirkend stellen?

Diese Kurzform ist nur eindeutig, wenn der Import aus einem ausgewählten Service heraus erfolgt oder der Service aus dem Dateinamen erkannt werden kann. Ein führendes X wird als Markierung gespeichert und nicht Teil der Frage. Ein abschließendes Semikolon wird bei reinen Fragenlisten toleriert.

Beispiel: Semikolon-CSV

frage;service_slug
Muss ich den Antrag neu stellen, wenn sich mein Einkommen ändert?;wohnbeihilfe
Welche Nachweise brauche ich?;wohnbeihilfe

Beispiel: erweiterte Importspalten

question,service,split,ziel,antwortmodus,expected_route,response_pattern,projection,gewicht
Wird ein bestimmtes Einkommen vorausgesetzt?,wohnbeihilfe,holdout,knowledge_answer,answerable,answer,"Einkommen|Grenze",free_first_turn,2

Die zusätzlichen Spalten expected_route, response_pattern und projection werden als Metadaten übernommen, erscheinen aber nicht im Standardexport.

CSV-Diagnose-Backlog

Der Diagnose-Backlog exportiert die aktuelle QS-Sicht als Arbeitsliste. Die Datei enthält unter anderem service_slug, frage_ref, projektion, diagnosegruppe, prioritaet, verdict, frage, antwort, begruendung, verbesserung und karten. Sie dient der fachlichen Nacharbeit und wird nicht wieder importiert.

Beispiel: Backlog-Zeile

service_slug,service_name,frage_ref,frage_id,projektion,diagnosegruppe,handlungsziel,chat_score,wissen_score,source_gap,prioritaet,verdict,issue_type,frage,antwort,begruendung,verbesserung,coverage_reason,karten
wohnbeihilfe,Wohnbeihilfe,Wohnbeihilfe-003,128,free_first_turn,Wissenslage,Wissenskarte ergänzen,72,40,ja,hoch,Teilweise richtig,knowledge_gap,"Welche Unterlagen brauche ich?","Antwortauszug ...","Begründung ...","Verbesserung ...","Quelle unvollständig","Karte A; Karte B"
Details zur QS-Bewertung mit Antwort, Ergebnis, Diagnosehinweisen und verwendeter Wissenskarte 1 2 3 4 5 6
Abb. T-04: Judge-Overlay mit Bewertung, Diagnose und Wissenskartenbezug.
MarkerElementBedeutung
1FrageZeigt, welche QS-Frage bewertet wurde.
2BewertungErklärt Antwort, Ergebnis, Einschätzung, Begründung und Verbesserung.
3DiagnosehinweiseZeigt nachvollziehbare Hinweise aus Bewertung und Antwortpipeline, falls vorhanden.
4KartenvergleichVergleicht verwendete, bestätigte und zusätzlich empfohlene Karten.
5WissenskarteZeigt die fachliche Quelle mit Sprung in den Reiter Fakten.
6SchliessenKehrt zur QS-Fragenliste zurück.

Beispiel: fachliche Lücke schließen

Wenn eine Antwort fachlich nicht beantwortet werden konnte, öffnen Sie die Bewertungsdetails, prüfen Sie die vom Judge empfohlenen Wissenskarten und wechseln Sie per Pfeil in den Reiter Fakten. Dort können Sie Antworttext, Kategorie oder Schlüsselwörter der Wissenskarte korrigieren und danach den QS-Lauf erneut starten.

Arbeitsablauf: Testfall aufzeichnen

  1. Starten Sie in Manuell eine neue Session.
  2. Starten Sie die Aufzeichnung.
  3. Führen Sie einen realistischen Dialog bis zum erwarteten Ergebnis.
  4. Stoppen Sie die Aufzeichnung.
  5. Prüfen Sie die vorgeschlagenen Prüfungen und Werte.
  6. Speichern Sie den Testfall.
  7. Führen Sie ihn in QS-Service & Assistenz erneut aus.

AFS-Split-Screen-Prüfung

Testen-Maske in der manuellen Sicht mit Chat, Eingabefeld, Recorder und Debugspalte 1 2 3 4 5
Abb. T-01: Manueller Testchat mit Recorder und Debugspalte.
MarkerElementBedeutung
1ManuellDirekter Test einer Chat-Session in der Admin-Oberfläche.
2ChatverlaufZeigt Assistenten- und Benutzernachrichten.
3EingabeSendet Testnachrichten an den Chat.
4Recorder, Export und JudgeZeichnet Testfälle auf, kopiert oder speichert den Chat, bewertet die aktuelle Antwort mit dem Judge oder startet neu.
5DebugspalteZeigt Ablauf, Schritt, Sprache und ausgewählten Service.

Abb. T-01 zeigt den manuellen Testkontext, in dem die AFS-Split-Screen-Prüfung durchgeführt wird. Die Formularvorschau erscheint parallel zum Chat, sobald ein geeigneter AFS-Link in der Session verfügbar ist.

Referenz: wichtige Prüfungen

PrüfungBedeutungTypischer Einsatz
Antwort okBot-Antwort ist technisch vorhanden und enthält keine Fehlerzeichen.Grundprüfung für jeden Erwartungsschritt.
Textankerwichtige erwartete oder verbotene Begriffe im Antworttext.Kurze fachliche Kernaussagen prüfen, ohne ganze Antwort festzunageln.
Stateerwarteter Workflow-Zustand.Dialogsteuerung stabil prüfen, wenn Text variieren darf.
Servicevorgeschlagener oder ausgewählter Service.Matching und Serviceauswahl absichern.
AFS-Felderim Chat abgefragte Formularfelder.Split-Screen-Markierung und Formularbefüllung prüfen.

Häufige Probleme

Querverweise