Text2Tech – Deep Learning-gestütztes Text Mining für Technologiemonitoring in der Automobilproduktion

Abschlussbericht

Loading...
Thumbnail Image

Editor

Advisor

Volume

Issue

Journal

Series Titel

Book Title

Publisher

Hannover : Technische Informationsbibliothek

Supplementary Material

Other Versions

Link to publishers' Version

Abstract

Im Projekt wurden Methoden und Systeme zur domänenspezifischen Informationsextraktion und Wissensmodellierung auf Basis großer Sprachmodelle entwickelt. Zentrale Ergebnisse umfassen den Aufbau einer Preprocessing- und ETL-Pipeline zur Aufbereitung großer Textmengen aus verschiedenen Quellen (Patente, Publikationen, Nachrichten, Förderprojekte) sowie die Erstellung und Annotation technologiebezogener Datensätze für Named Entity Recognition (NER), Relation Extraction (RE) und Entity Linking. Darauf aufbauend wurden spezialisierte neuronale Modelle entwickelt und mittels Fine-Tuning, Prompt- und Hyperparameter-Optimierung sowie Vergleich verschiedener Large Language Models unterschiedlicher Größe und Quantisierung evaluiert. Ergänzend wurden Verfahren des Entity Linking (regelbasiert, encoder- und decoderbasiert) implementiert und zur Normalisierung semantisch identischer Einträge eingesetzt. Die extrahierten Entitäten und Relationen wurden in einer domänenspezifischen Wissensbasis auf Basis von Neo4j modelliert, in der Entitäten als Knoten und Relationen als Kanten abgebildet sind. Abschließend wurden alle Komponenten in einer dockerisierten Demonstratoranwendung mit React-Frontend, Python-Backend und Neo4j-Datenbank integriert, die eine interaktive Extraktion, Abfrage und Visualisierung eines mit Hilfe der entwickelten Methoden aufgebauten Wissensgraphen über eine Teilmenge der Texte ermöglicht.

Description

Keywords GND

Conference

Publication Type

Report

Version

publishedVersion

License

Creative Commons Attribution-NonDerivs 3.0 Germany