<div class="csl-bib-body">
<div class="csl-entry">Zhang, R. (2026). <i>Immersive Real-Time Language Translator for Augmented Reality</i> [Diploma Thesis, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.132546</div>
</div>
-
dc.identifier.uri
https://doi.org/10.34726/hss.2026.132546
-
dc.identifier.uri
http://hdl.handle.net/20.500.12708/229206
-
dc.description
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft
-
dc.description.abstract
Echtzeit-Übersetzungsysteme sind auf traditionellen Plattformen wie Smartphones und Desktop-Anwendungen weit verbreitet. Während Smartphones und menschliche Dolmetscher Übersetzungen ermöglichen, sind diese Lösungen aufdringlich und stören den natürlichen Redefluss. Augmented-Reality-Brillen (AR) bieten eine Alternative, da die Übersetzungen direkt in die reale Umgebung des Nutzers einbetten. Wie verschiedene Übersetzungsmodalitäten in AR dargestellt werden sollten und wie sie das Verständnis in persönlichen Gesprächen beeinflussen, ist jedoch bislang noch kaum erforscht.In dieser Arbeit präsentieren wir ein Echtzeit-Übersetzungssystem, das auf Spectacles AR-Brille implementiert wurde und automatische Spracherkennung (ASR), Übersetzung mittels Large Language Models (LLM) sowie Text-to-Speech-Synthese (TTS) integriert. Das System ermöglicht zwei Nutzern, die verschiedene Sprachen sprechen, eine Übersetzung in unter vier Sekunden. Es wurden drei Übersetzungsmodalitäten entwickelt und evaluiert: (1) Untertitel, (2) synthetische Sprachausgabe (TTS) und (3) eine Kombination aus Untertiteln und synthetische Sprachausgabe.Zur Bewertung des Systems und des Effekts der Übersetzungsmodalitäten wurde eine Within-Subjects-Nutzerstudie (N=24) durchgeführt, bei der 12 Paare ein Gespräch in zwei verschiedenen Sprachen führten mit allen drei Bedingungen. Gesprächsverständnis, Übersetzungs- und Interaktionsqualität, Benutzerfreundlichkeit und kognitive Belastung wurden mittels Fragebögen sowie objektiven Maßen für Aufgaben- und Systemleistung bewertet.Die Ergebnisse zeigen, dass die Übersetzungsmodalität das wahrgenommene Gesprächsverständnis beeinflusste. Die Teilnehmenden berichteten, dass ihre Gesprächspartner bei der Nutzung von synthetischer Sprachausgabe oder der kombinierten Bedingung angemessener reagierten als bei Untertiteln alleine. Der wahrgenommene Erfolg war in der kombinierten Bedingung ebenfalls höher, obwohl keine signifikanten Unterschiede in der objektiven Aufgabenleistung festgestellt wurden.Basierend auf diesen Erkenntnissen werden Designempfehlungen für zukünftige AR-Übersetzungssysteme vorgeschlagen, wie Verbesserung der Latenz, Untertitel-Tempo und Synchronisation. Mögliche Anwendungsgebiete AR-gestützter mehrsprachiger Kommunikation werden in verschiedenen Bereichen diskutiert, darunter Sprachenlernen, Bildung, Gesundheitswesen und Barrierefreiheit.Wir zeigen, dass AR-Brillen die mehrsprachige Echtzeitkommunikation effektiv unterstützen können und eine praktische Alternative zu traditionellen Übersetzungsansätzen bieten.
de
dc.description.abstract
Real-time translation systems have become widely available on traditional platforms such as smartphones and desktop applications. While smartphones and human interpreters provide rapid translation, these solutions are obtrusive and disrupt natural conversational flow. Augmented Reality (AR) glasses offer a promising alternative by embedding translation directly in the user's real environment. However, how different translation modalities should be presented in AR and how they affect comprehension in face-to-face conversation remains underexplored.In this thesis, we present a real-time multilingual communication system implemented on Snap's Spectacles AR glasses, which integrates automatic speech recognition (ASR), large language model (LLM)-based translation and text-to-speech (TTS) synthesis. The system enables two users speaking different languages with speech-to-speech translation returning under four seconds. Three translation modalities were designed and evaluated: (1) subtitles, (2) synthetic speech (TTS) and (3) a multimodal combination of subtitles and synthetic speech.In order to evaluate the system and the effect of translation modalities, a within-subjects user study (N=24) was conducted, in which 12 pairs experienced all three conditions while holding a conversation in two distinct languages. Conversational comprehension, translation quality, interaction quality, usability and cognitive load were assessed through questionnaires, alongside objective measures for task and system performance.Results show that translation modality affected perceived conversational comprehension. Participants reported that their conversation partners responded more appropriately when using synthetic speech or the multimodal condition compared to subtitles alone. Perceived task success was also higher in the multimodal condition, despite no significant differences in objective task performance. Based on these findings, design recommendations for future AR translation systems are proposed, which address latency, subtitle pacing and modality synchronization. Potential applications of AR-assisted multilingual communication are discussed across domains, such as language learning, education, healthcare and accessibility.We demonstrate that AR glasses can effectively support real-time multilingual communication, offering a practical alternative to traditional translation approaches.
en
dc.language
English
-
dc.language.iso
en
-
dc.rights.uri
http://rightsstatements.org/vocab/InC/1.0/
-
dc.subject
Augmented Reality
en
dc.subject
Language Translation
en
dc.subject
Real-Time
en
dc.title
Immersive Real-Time Language Translator for Augmented Reality
en
dc.type
Thesis
en
dc.type
Hochschulschrift
de
dc.rights.license
In Copyright
en
dc.rights.license
Urheberrechtsschutz
de
dc.identifier.doi
10.34726/hss.2026.132546
-
dc.contributor.affiliation
TU Wien, Österreich
-
dc.rights.holder
Renate Zhang
-
dc.publisher.place
Wien
-
tuw.version
vor
-
tuw.thesisinformation
Technische Universität Wien
-
dc.contributor.assistant
Bosco, Matteo
-
tuw.publication.orgunit
E193 - Institut für Visual Computing and Human-Centered Technology
-
dc.type.qualificationlevel
Diploma
-
dc.identifier.libraryid
AC17913457
-
dc.description.numberOfPages
109
-
dc.thesistype
Diplomarbeit
de
dc.thesistype
Diploma Thesis
en
dc.rights.identifier
In Copyright
en
dc.rights.identifier
Urheberrechtsschutz
de
tuw.advisor.staffStatus
staff
-
tuw.assistant.staffStatus
staff
-
tuw.advisor.orcid
0000-0002-0322-9869
-
tuw.assistant.orcid
0009-0003-5580-7477
-
item.openairecristype
http://purl.org/coar/resource_type/c_bdcc
-
item.mimetype
application/pdf
-
item.openairetype
master thesis
-
item.openaccessfulltext
Open Access
-
item.grantfulltext
open
-
item.languageiso639-1
en
-
item.fulltext
with Fulltext
-
item.cerifentitytype
Publications
-
crisitem.author.dept
E193 - Institut für Visual Computing and Human-Centered Technology