Text2Tech – Deep Learning-gestütztes Text Mining für Technologiemonitoring in der Automobilproduktion
Abschlussbericht
Date
Editor
Advisor
Volume
Issue
Journal
Series Titel
Book Title
Publisher
Supplementary Material
Other Versions
Link to publishers' Version
Abstract
Im Projekt wurden Methoden und Systeme zur domänenspezifischen Informationsextraktion und Wissensmodellierung auf Basis großer Sprachmodelle entwickelt. Zentrale Ergebnisse umfassen den Aufbau einer Preprocessing- und ETL-Pipeline zur Aufbereitung großer Textmengen aus verschiedenen Quellen (Patente, Publikationen, Nachrichten, Förderprojekte) sowie die Erstellung und Annotation technologiebezogener Datensätze für Named Entity Recognition (NER), Relation Extraction (RE) und Entity Linking. Darauf aufbauend wurden spezialisierte neuronale Modelle entwickelt und mittels Fine-Tuning, Prompt- und Hyperparameter-Optimierung sowie Vergleich verschiedener Large Language Models unterschiedlicher Größe und Quantisierung evaluiert. Ergänzend wurden Verfahren des Entity Linking (regelbasiert, encoder- und decoderbasiert) implementiert und zur Normalisierung semantisch identischer Einträge eingesetzt. Die extrahierten Entitäten und Relationen wurden in einer domänenspezifischen Wissensbasis auf Basis von Neo4j modelliert, in der Entitäten als Knoten und Relationen als Kanten abgebildet sind. Abschließend wurden alle Komponenten in einer dockerisierten Demonstratoranwendung mit React-Frontend, Python-Backend und Neo4j-Datenbank integriert, die eine interaktive Extraktion, Abfrage und Visualisierung eines mit Hilfe der entwickelten Methoden aufgebauten Wissensgraphen über eine Teilmenge der Texte ermöglicht.
