Hochreiter, F. (2026). Leveraging Existing Natural Language Processing Techniques for Effective Text-to-Pictogram Translation for Digital Calendar Entries [Diploma Thesis, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.120654
E193 - Institut für Visual Computing and Human-Centered Technology
-
Date (published):
2026
-
Number of Pages:
98
-
Keywords:
natural language processing; calendar entries; text-to-pictogram translation
en
Abstract:
Die automatische Übersetzung von Text in Piktogramme unterstützt Menschen mit komplexen Kommunikationsbedürfnissen, die zusätzlich auf unterstützte Kommunikation zurückgreifen. Insbesondere die Übersetzung textbasierter Kalendereinträge in Piktogramme hat das Potenzial, Menschen mit kognitiven Beeinträchtigungen dabei zu helfen, ihren Alltag besser zu strukturieren. Diese Arbeit untersucht, ob etablierte Verfahren der natürlichen Sprachverarbeitung ausreichen, um deutsche und englische Kalendereinträge in ARASAAC-Piktogrammsequenzen zu übersetzen. Der enge Anwendungsbereich von Kalendereinträgen birgt mehrere Herausforderungen, wobei die Knappheit an Trainingskorpora und der Mangel an verfügbaren, qualifizierten Experten die größten Probleme darstellen. Es wird eine regelbasierte hybride Pipeline entwickelt, die die Informationen zu SUMMARY, LOCATION und ATTENDEE der iCalendar-Felder durch eine vierstufige Kaskade aus Mehrwortabgleich, exakter Schlüsselwort-Suche, lemma-basiertem Fallback sowie WordNet- und Hypernym-Traversierung verarbeitet. Darüber hinaus verwendet jedes iCalendar-Feld feldspezifische Stufen.Die Pipeline wird anhand synthetischer Datensätze mit etwa 50 Kalendereinträgen pro Sprache trainiert und anschließend anhand eines für jede Sprache zurückbehaltenen Testdatensatzes mit echten Nutzern bewertet, der jeweils aus 15 Kalendereinträgen besteht. Die Daten wurden über das in Wien ansässige Unternehmen Independo gesammelt. Die Übersetzungsgenauigkeit wird anhand eines Annotationsformats mit Klammergruppen bewertet, mit dem mehrere mögliche Piktogrammübersetzungen für dieselben Konzepte erfasst werden, sowie anhand gängiger Klassifikationsmetriken wie dem makro-gemittelten slotbasierten und dem pro-Vorhersage-F1-Score, ergänzt durch die Abdeckung und die Verteilung der Übereinstimmungstypen als diagnostische Kennzahlen. Das System erreicht einen Makro-F1-Wert von 0,917 für den englischen Testsatz und von 0,910 für die deutschen Testdaten. Die verbleibenden Fehler lassen sich zurückverfolgen und weisen auf Lücken in ARASAAC und den kuratierten lexikalischen Wörterbüchern hin. Eine geplante Expertenbewertung gemäß ISO 18587 konnte nicht durchgeführt werden, da es an Experten mangelte, die die Anforderungen der ISO 18587 und die Anforderungen aus dem AAC-Bereich erfüllten. Dieses Scheitern bei der Rekrutierung ist an sich schon ein struktureller Befund.
de
The automatic translation of text into pictograms supports individuals with complexcommunication needs who further use augmentative and alternative communication. Particularly, the translation of text-based calendar entries into pictograms has the potential to help individuals with cognitive impairments to improve the structure of their everyday life. This thesis investigates whether established natural language processing techniques are sufficient for translating German and English calendar entries into ARASAAC pictogram sequences. The narrow domain of calendar entries poses several challenges, where the scarcity of training corpora and the lack of available, qualified experts are the major issues at hand.A rule-based hybrid pipeline is developed that processes the SUMMARY, LOCATION, and ATTENDEE information of iCalendar fields through a four-tier cascade of multi-word matching, exact keyword lookup, lemma-based fallback, and WordNet and hypernym traversal. Furthermore, each iCalendar field uses field-specific tiers.The pipeline is tuned on synthetic datasets of approximately 50 calendar entries per language, and afterwards evaluated on a held-out real-user test set for each language, consisting of 15 calendar entries each. The data was gathered via the Viennese-based Independo.Translation correctness is assessed by applying a bracket-group annotation format for capturing multiple possible pictogram translations for the same concepts, and common classification metrics like macro-averaged slot-based and per-prediction F1 score, alongside with the coverage and the match-type distribution as diagnostic measures.The system reaches macro F1 of 0.917 for the English test set and 0.910 for the German test data. The residual errors can be traced and identify gaps in ARASAAC and the curated lexical dictionaries. A planned expert evaluation adhering to ISO 18587 could not be executed due to the lack of experts fulfilling the requirements for ISO 18587 and requirements from the AAC domain. This recruitment failure is itself a structural finding.
en
Additional information:
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft