Die Forschungsgruppe Web & Software Engineering der HTWK Leipzig hat beim internationalen BEA-Wettbewerb zur Bewertung deutscher Kurzantworten in allen vier Wertungen das Podium erreicht
Die Forschungsgruppe Web & Software Engineering (WSE Research) der HTWK Leipzig hat beim internationalen BEA-Wettbewerb in San Diego zur Bewertung deutscher Kurzantworten in allen vier Wertungen das Podium erreicht. Unter neun Teams belegten Doktorand Jonas Gwozdz und Prof. Dr. Andreas Both im Juli 2026 dreimal den zweiten und einmal den dritten Platz. Die Aufgabe verbindet Sprachverarbeitung mit einer Frage aus dem Bildungsalltag: Wie gut kann eine KI erkennen, ob ein Schüler eine fachliche Frage richtig beantwortet hat?
Der Wettbewerb gehört zum Workshop „Building Educational Applications“, kurz BEA, der als Teil einer weltweit führenden Konferenzen für Natural Language Processing (NLP) und Computerlinguistik – ACL 2026 – durchgeführt wurde. In einem Wettbewerb, einem sogenannten Shared Task, vergleichen Forschungsteams ihre entwickelten Verfahren anhand derselben Daten und Bewertungsregeln.
Fachlich richtig, teilweise richtig oder falsch?
Hintergrund dieses Wettbewerbs ist das Forschungsziel, eine hochqualitative automatische Bewertung von Antworten auf Prüfungsfragen zu erreichen. Dabei stellt sich als besonderes Problem dar, dass wer eine Antwort in eigenen Worten formuliert, selten genau die Begriffe einer Musterlösung verwendet. Eine andere Formulierung kann denselben Inhalt ausdrücken; eine fachlich klingende Antwort kann dagegen einen wesentlichen Zusammenhang verfehlen. Das macht die automatische Korrektur anspruchsvoll. Ein bloßer Abgleich einzelner Wörter reicht dafür nicht aus.
Im BEA-Wettbewerb erhielten alle teilnehmenden Systeme deshalb zur Frage und Schülerantwort auch einen ausformulierten Bewertungsmaßstab. Er beschreibt, welche Inhalte für eine richtige oder teilweise richtige Antwort erforderlich sind. Die Beispiele stammen aus deutschsprachigen Aufgaben im mathematisch-naturwissenschaftlichen Bereich. Für Training und Entwicklung standen insgesamt 7.899 bereits bewertete Antworten zu 78 Fragen zur Verfügung.
Die vier Wertungen prüfen unterschiedliche Anforderungen. Ein Teil untersucht neue Antworten auf bereits bekannte Fragen, ein anderer Antworten auf bislang unbekannte Fragen. Hinzu kommen zwei Bewertungsschemata: entweder richtig, teilweise richtig und falsch oder eine binäre Entscheidung, bei der auch teilweise richtige Antworten als falsch zählen. Besonders bei unbekannten Fragen muss das System einen neuen Bewertungsmaßstab anwenden können.
Wann hilft die Kombination mehrerer Verfahren?
Das WSE-Team untersuchte verschiedene Wege zur Bewertung. Sprachmodelle erhielten gezielte Anweisungen und passende, bereits bewertete Beispielantworten. Daneben passten die Forscher sogenannte große Sprachmodelle (Large Language Models, LLMs) durch zusätzliches Training an die Aufgabe an. Dafür verwendeten sie LoRA, ein Verfahren, das nur einen vergleichsweise kleinen Satz zusätzlicher Modellparameter trainiert.
Bei bekannten Fragen half es, die Bewertungen mehrerer Modelle gewichtet zusammenzuführen. Bei unbekannten Fragen schnitt dagegen ein einzelnes größeres, angepasstes Modell besser ab als die Kombination. Für die Forschung ist diese Unterscheidung relevant: Eine gute Lösung für wiederkehrende Aufgaben lässt sich nicht ohne Prüfung auf neue Fragen übertragen.
Die Arbeit entstand in der von Prof. Both geleiteten Forschungsgruppe an der Fakultät Informatik und Medien. Doktorand Jonas Gwozdz untersucht dort, wie Sprachmodelle die Bewertung von Prüfungsleistungen unterstützen können. Der Wettbewerb liefert dafür einen Vergleich unter festgelegten Bedingungen. Ob sich die Ergebnisse auf andere Fächer und Bildungsstufen übertragen lassen, muss gesondert untersucht werden. Auch die Einbindung in die Arbeit von Lehrkräften bleibt eine eigene Forschungsaufgabe.
Veröffentlichung:
Jonas Gwozdz and Andreas Both. 2026.WSE Research at BEA 2026 Shared Task 2: Multi-Strategy Rubric-Based Short Answer Scoring for German. In Proceedings of the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), pages 1210–1216, San Diego, California, USA. Association for Computational Linguistics.
