FINEST
Über das Projekt
- Vollständiger Name des Projekts: Kooperationskompetenz im Technologietransfer – Identifikation und Evaluation von Partnern anhand von Patentinformationen
- Projektakronym: FINEST
- Studie: KI-basierte Sprachverarbeitungsumgebung
- Förderzeitraum: 2025 – 2028
- Projekt-Homepage: FINEST
Daten trainiert wurden. Militärische Fachdomänen unterscheiden sich davon deutlich: Sie verwenden eigene Terminologie, spezifische Textsorten und Sprachregister und unterliegen besonderen Anforderungen an Datenschutz, Nachvollziehbarkeit und IT-Sicherheit. Diese Besonderheiten sind in bestehenden Modellen unzureichend berücksichtigt. Übersetzungsprozesse im militärischen Umfeld stellen daher erhöhte Anforderungen an Qualität und Sicherheit. Der Einsatz von LLMs kann hier Vorteile bringen, erfordert jedoch eine systematische Evaluierung, gezielte Domänenanpassung und eine sorgfältige Betrachtung möglicher Risiken. Das Projekt untersucht deshalb, unter welchen Bedingungen LLM-basierte Verfahren einen messbaren Mehrwert gegenüber klassischer NMÜ bieten und wo ihre Grenzen liegen.
Methodisch folgt das Vorhaben einem mehrstufigen, empirischen Ansatz. Zunächst wird eine gesicherte Studien- und Evaluierungsumgebung aufgebaut, relevante Fachdomänen und Sprachpaare werden ausgewählt und Baseline-Experimente mit vortrainierten Modellen durchgeführt. Darauf aufbauend erfolgt die domänenspezifische Anpassung und Ergänzung der Modelle. Hierbei werden verschiedene Verfahren systematisch verglichen, insbesondere promptbasierte Erweiterungen mit domänenspezifischen Ressourcen, Retrieval-Augmented Generation (RAG) in unterschiedlichen Ausprägungen sowie Fine-Tuning mit fachdomänenspezifischen Übersetzungsdaten.
Parallel dazu wird eine Evaluierungsumgebung entwickelt, die automatisierte Metriken und menschliche Bewertungen einsetzt, um Verbesserungen gegenüber den Baselines nachvollziehbar und reproduzierbar zu messen. Ergänzend werden weitere Aspekte untersucht, darunter die Auswirkungen von Anonymisierung auf die Übersetzungsqualität, Ansätze zur zyklischen Generierung von Trainingsdaten, der Vergleich unterschiedlicher Modellgrößen und -architekturen sowie die Integration automatisierter Postediting-Verfahren.
Die im Projekt gewonnenen Ergebnisse werden schließlich zu konsistenten Handlungsempfehlungen für eine souveräne und sicherheitskonforme Nutzung KI-gestützter Sprachverarbeitung innerhalb der Bundeswehr zusammengefasst. Dadurch entstehen evidenzbasierte Aussagen zum tatsächlichen Nutzen von LLMs in der militärischen Fachübersetzung, methodisch abgesicherte Evaluations- und Benchmarkingansätze sowie wissenschaftliche Grundlagen für weiterführende Forschung, Implementierung und strategische Entscheidungsprozesse im Bereich KI-gestützter Sprachverarbeitung.
Projektpartner
- Bundessprachenamt
- Zentrum Digitalisierung der Bundeswehr
- Universität der Bundeswehr München