Zhang, R. (2026). Immersive Real-Time Language Translator for Augmented Reality [Diploma Thesis, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.132546
E193 - Institut für Visual Computing and Human-Centered Technology
-
Date (published):
2026
-
Number of Pages:
109
-
Keywords:
Augmented Reality; Language Translation; Real-Time
en
Abstract:
Echtzeit-Übersetzungsysteme sind auf traditionellen Plattformen wie Smartphones und Desktop-Anwendungen weit verbreitet. Während Smartphones und menschliche Dolmetscher Übersetzungen ermöglichen, sind diese Lösungen aufdringlich und stören den natürlichen Redefluss. Augmented-Reality-Brillen (AR) bieten eine Alternative, da die Übersetzungen direkt in die reale Umgebung des Nutzers einbetten. Wie verschiedene Übersetzungsmodalitäten in AR dargestellt werden sollten und wie sie das Verständnis in persönlichen Gesprächen beeinflussen, ist jedoch bislang noch kaum erforscht.In dieser Arbeit präsentieren wir ein Echtzeit-Übersetzungssystem, das auf Spectacles AR-Brille implementiert wurde und automatische Spracherkennung (ASR), Übersetzung mittels Large Language Models (LLM) sowie Text-to-Speech-Synthese (TTS) integriert. Das System ermöglicht zwei Nutzern, die verschiedene Sprachen sprechen, eine Übersetzung in unter vier Sekunden. Es wurden drei Übersetzungsmodalitäten entwickelt und evaluiert: (1) Untertitel, (2) synthetische Sprachausgabe (TTS) und (3) eine Kombination aus Untertiteln und synthetische Sprachausgabe.Zur Bewertung des Systems und des Effekts der Übersetzungsmodalitäten wurde eine Within-Subjects-Nutzerstudie (N=24) durchgeführt, bei der 12 Paare ein Gespräch in zwei verschiedenen Sprachen führten mit allen drei Bedingungen. Gesprächsverständnis, Übersetzungs- und Interaktionsqualität, Benutzerfreundlichkeit und kognitive Belastung wurden mittels Fragebögen sowie objektiven Maßen für Aufgaben- und Systemleistung bewertet.Die Ergebnisse zeigen, dass die Übersetzungsmodalität das wahrgenommene Gesprächsverständnis beeinflusste. Die Teilnehmenden berichteten, dass ihre Gesprächspartner bei der Nutzung von synthetischer Sprachausgabe oder der kombinierten Bedingung angemessener reagierten als bei Untertiteln alleine. Der wahrgenommene Erfolg war in der kombinierten Bedingung ebenfalls höher, obwohl keine signifikanten Unterschiede in der objektiven Aufgabenleistung festgestellt wurden.Basierend auf diesen Erkenntnissen werden Designempfehlungen für zukünftige AR-Übersetzungssysteme vorgeschlagen, wie Verbesserung der Latenz, Untertitel-Tempo und Synchronisation. Mögliche Anwendungsgebiete AR-gestützter mehrsprachiger Kommunikation werden in verschiedenen Bereichen diskutiert, darunter Sprachenlernen, Bildung, Gesundheitswesen und Barrierefreiheit.Wir zeigen, dass AR-Brillen die mehrsprachige Echtzeitkommunikation effektiv unterstützen können und eine praktische Alternative zu traditionellen Übersetzungsansätzen bieten.
de
Real-time translation systems have become widely available on traditional platforms such as smartphones and desktop applications. While smartphones and human interpreters provide rapid translation, these solutions are obtrusive and disrupt natural conversational flow. Augmented Reality (AR) glasses offer a promising alternative by embedding translation directly in the user's real environment. However, how different translation modalities should be presented in AR and how they affect comprehension in face-to-face conversation remains underexplored.In this thesis, we present a real-time multilingual communication system implemented on Snap's Spectacles AR glasses, which integrates automatic speech recognition (ASR), large language model (LLM)-based translation and text-to-speech (TTS) synthesis. The system enables two users speaking different languages with speech-to-speech translation returning under four seconds. Three translation modalities were designed and evaluated: (1) subtitles, (2) synthetic speech (TTS) and (3) a multimodal combination of subtitles and synthetic speech.In order to evaluate the system and the effect of translation modalities, a within-subjects user study (N=24) was conducted, in which 12 pairs experienced all three conditions while holding a conversation in two distinct languages. Conversational comprehension, translation quality, interaction quality, usability and cognitive load were assessed through questionnaires, alongside objective measures for task and system performance.Results show that translation modality affected perceived conversational comprehension. Participants reported that their conversation partners responded more appropriately when using synthetic speech or the multimodal condition compared to subtitles alone. Perceived task success was also higher in the multimodal condition, despite no significant differences in objective task performance. Based on these findings, design recommendations for future AR translation systems are proposed, which address latency, subtitle pacing and modality synchronization. Potential applications of AR-assisted multilingual communication are discussed across domains, such as language learning, education, healthcare and accessibility.We demonstrate that AR glasses can effectively support real-time multilingual communication, offering a practical alternative to traditional translation approaches.
en
Additional information:
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft