Die Qualitätssicherung moderner Webanwendungen durch End-to-End- (E2E-)Tests ist
ein kritischer Erfolgsfaktor, der in der Praxis jedoch oft durch ressourcenintensive und
fehleranfällige manuelle Prozesse behindert wird. Diese Bachelorarbeit untersucht
empirisch, inwieweit Large Language Models (LLMs) die Transformation
natürlichsprachlicher Anforderungen in strukturierte Testspezifikationen und ausführbaren
Testcode automatisieren können.
In einem zweistufigen experimentellen Design wurde zunächst die semantische Fähigkeit
verschiedener Modelle (Gemini 3 Pro, GPT-5, Qwen 3) evaluiert, Anforderungen in
Gherkin-Szenarien zu überführen. Die Ergebnisse zeigen, dass die Prompting-Strategie
einen signifikanten Einfluss hat: Der Few-Shot-Ansatz erwies sich als überlegen,
während komplexere Verfahren wie Chain-of-Thought (CoT) im Kontext formaler Syntax
kontraproduktiv wirkten. Zudem wurde eine lineare Abhängigkeit zwischen der Qualität
der Eingabeanforderungen und der Präzision der Ausgabe nachgewiesen.
In der zweiten Phase wurde die technische Synthese von Java-Playwright-Code validiert.
Der Proof of Concept bestätigte zwar eine hohe syntaktische Kompetenz der Modelle mit
einer Parsing-Rate von 100%, offenbarte jedoch funktionale Grenzen bei der
Zustandsvalidierung (42,5% Erfolgsquote) aufgrund fehlender Laufzeit-Rückkopplung.
Die Arbeit kommt zu dem Schluss, dass LLMs aktuell nicht als autonome Test-Agenten,
sondern als hocheffiziente "Translation Engines" in einem hybriden "Human-in-the-Loop"-
Prozess eingesetzt werden sollten
