AnDy: Automatische Analyse der Dynamik dialektalen Sprechens mit Methoden der Künstlichen Intelligenz
Date
Authors
Editor
Advisor
Volume
Issue
Journal
Series Titel
Book Title
Publisher
Supplementary Material
Other Versions
Link to publishers' Version
Abstract
Gegenstand des Vorhabens war die Entwicklung einer KI-gestützten Forschungsumgebung für die automatisierte Analyse regionalsprachlicher Variation im Deutschen. Frühere Arbeiten der Regionalsprachenforschung hatten verschiedene Sprechertypen nachgewiesen, deren Variationsverhalten zwischen den Polen Standardsprache und Dialekt sich unterscheidet (Typ Switcher, Shifter, Moveless). Die genauen Zusammenhänge zwischen diesem Verhalten und den sozialen, biographischen und situativen Bedingungen der Sprecher waren jedoch nicht systematisch und insbesondere nicht raumübergreifend untersucht. Ursache war ein methodisches Defizit: Die Forschung verfügte nur über statische Datenzugänge, bei denen einzelne Gesprächsausschnitte analysiert wurden, während ein datenklassifizierender Zugang fehlte, der die Dynamik eines Gesprächs in seinem Verlauf erfasst. Ziel war es daher, mit Methoden der Künstlichen Intelligenz erstmals eine dynamisch angelegte und zugleich raumvergleichende Analyse variativer Sprechertypen zu ermöglichen und dabei die Datenkompetenzen des fachwissenschaftlichen Nachwuchses zu stärken. Das Vorhaben knüpfte an drei Forschungsstränge an. In der Datennutzung der Regionalsprachenforschung wurden Sprechertypen bislang schematisch über den durchschnittlichen Anteil dialektaler Merkmale bestimmt; eine sequenzbasierte, signalbasierte Diagnostik fehlte, und die Auswertung von Tonaufnahmen erfolgte überwiegend impressionistisch. In der Forschung zu Sprechertypen dominierte die auf Labov zurückgehende Variablenanalyse, die eine globale Bewertung liefert, jedoch nicht erkennen lässt, in welchen Diskursmomenten Variation einsetzt. In den maschinellen Lernverfahren der variationsbezogenen Computerlinguistik lagen Ansätze zur Dialekterkennung überwiegend für Text vor; audiobasierte Verfahren für das Deutsche fehlten weitgehend. Technisch knüpfte das Vorhaben an vortrainierte akustische Repräsentationen, Sprecherrepräsentationsverfahren und zeitabhängige neuronale Modelle an.
