Panner, E. W. (2026). Mixed Reality for Firefighting: Explainable AI for In-Situ Hazard Assessment [Diploma Thesis, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.137300
Brandsicherheitsbeurteilungen und Feuerwehrtraining erfordern eine schnelle Interpretation von Gefahren unter Unsicherheit, eingeschränkter Sicht, Zeitdruck und hoher kognitiver Belastung. Aktuelle Fortschritte in künstlicher Intelligenz (KI) und Computer Vision (CV) ermöglichen die automatische Erkennung visueller Gefahrenindikatoren wie Feuer, Rauch, Feuerlöschern und Alarmsystemen. Solche Ausgaben werden jedoch häufig lediglich als Labels, Bounding Boxes oder Konfidenzwerte dargestellt, ohne ausreichende kontextuelle Erklärung. In sicherheitskritischen Umgebungen erschwert dies die Kalibrierung von Vertrauen, die Interpretierbarkeit und die Einschätzung, ob eine KI-Ausgabe menschliches Urteilsvermögen unterstützen sollte. Mixed Reality (MR) bietet die Möglichkeit, KI-generierte Informationen direkt im Sichtfeld der Nutzer:innen darzustellen. Diese Arbeit untersucht daher, wie KI-basierte Gefahrenerkennung durch lokale visuelle Erklärungen, also Explainable AI (XAI), in In-situ-MR-Unterstützung übersetzt werden kann.Auf Grundlage eines Design-Science-Research-Ansatzes (DSR) wurde in dieser Arbeit eine prototypische Instanz eines MR-XAI-Translation-Layer-Frameworks entwickelt und evaluiert. Der Prototyp bestand aus einer YOLO-basierten Pipeline zur Gefahrenerkennung, einem FastAPI-Backend für Inferenz und Erklärungsgenerierung sowie einem Unity-basierten MR-Client auf der Meta Quest 3. Das System unterstützte interaktive Gefahrenerkennung auf Prototypniveau, MR-basierte visuelle Overlays und bedarfsgesteuerte Erklärungsgenerierung mithilfe CAM-basierter Attributionsmethoden, darunter EigenCAM und Grad-CAM++. Der Prototyp wurde in zwei formativen Fallstudienrunden mit 16 Teilnehmenden evaluiert. Die thesis-spezifische Analyse verglich ununterstützte Gefahrenerkennung mit einer XAI-gestützten MR-Bedingung. Die quantitativen Daten umfassten Aufgabenbearbeitungszeit, vereinfachte NASA-TLX-basierte Workload-Werte, wahrgenommene situative Wahrnehmung sowie Vertrauens- und Zuverlässigkeitsbewertungen; qualitatives Feedback der Teilnehmenden und Beobachtungen der Forschenden wurden genutzt, um Usability und technische Einschränkungen zu interpretieren.Die Ergebnisse zeigen, dass die Integration KI-basierter Gefahrenerkennung und lokaler visueller Erklärungen in eine MR-Schnittstelle auf Prototypniveau technisch machbar ist. Die XAI-gestützte MR-Bedingung verbesserte jedoch weder die Aufgabenbearbeitungszeit noch die durchschnittliche wahrgenommene situative Wahrnehmung im Vergleich zur ununterstützten Inspektion. Über 13 gültige gepaarte Zeitmessungen hinweg war die ununterstützte Inspektion durchgehend schneller als die XAI-gestützte MR-Bedingung. Die vereinfachten NASA-TLX-basierten Workload-Werte blieben im niedrigen bis moderaten Bereich, waren in der zweiten Runde jedoch für die XAI-gestützte MR-Bedingung höher als für die ununterstützte Baseline-Bedingung. Qualitatives Feedback zeigte dennoch, dass Erklärungen Interpretation und Verständnis unterstützen konnten, wenn Erkennungen und Erklärungen korrekt, stabil und räumlich lesbar waren.Ein zentrales Ergebnis ist, dass die Nützlichkeit von Erklärbarkeit in MR von der Zuverlässigkeit und Stabilität der gesamten Pipeline aus Wahrnehmung und Erklärung abhängt. Die Teilnehmenden vertrauten den Erklärungen stärker als den zugrunde liegenden Gefahrenerkennungen, während die wahrgenommene Systemzuverlässigkeit niedriger bewertet wurde. Verpasste Erkennungen, Fehlklassifikationen, verschwindende Overlays, verzögerte Erklärungen und Interaktionsunklarheiten reduzierten Vertrauen und begrenzten die praktische Nützlichkeit. Erklärbarkeit allein kann daher unzuverlässige Wahrnehmung oder instabiles Interface-Verhalten nicht kompensieren. Diese Arbeit leistet einen Beitrag durch einen funktionsfähigen MR-XAI-Forschungsprototyp, formatives Evaluationswissen zu Workload, wahrgenommener situativer Wahrnehmung, Vertrauen und Interaktionsherausforderungen sowie Designimplikationen für erklärbare MR-Systeme in sicherheitskritischen Umgebungen. Für die Feuerwehrdomäne zeigt die Arbeit das Potenzial von In-situ-Erklärungen zur Unterstützung der Gefahreninterpretation, macht jedoch zugleich deutlich, dass robuste Erkennung, stabile räumliche Darstellung, geringe Interaktionsbelastung und klare Unsicherheitskommunikation Voraussetzungen für operative Relevanz sind.
de
Fire-safety assessment and firefighter training require rapid interpretation of hazards under uncertainty, degraded visibility, time pressure, and high cognitive load. Recent advances in artificial intelligence (AI) and computer vision (CV) enable automated detection of visual hazard indicators such as fire, smoke, extinguishers, and alarm systems. However, such outputs are often presented as labels, bounding boxes, or confidence scores without sufficient contextual explanation. In safety-critical environments, this limits trust calibration, interpretability, and the ability to assess whether an AI output should inform human judgement. Mixed reality (MR) offers the possibility of presenting AI-generated information directly in the user's field of view. This thesis therefore investigates how AI-based hazard detection can be translated into in-situ MR guidance through local visual explanations, i.e. explainable AI (XAI).Following a Design Science Research (DSR) approach, the thesis developed and evaluated a prototype instantiation of an MR-XAI translation-layer framework. The prototype consisted of a YOLO-based hazard detection pipeline, a FastAPI backend for inference and explanation generation, and a Unity-based MR client implemented on the Meta Quest 3. The system supported interactive prototype-level hazard detection, MR-based visual overlays, and on-demand explanation generation using CAM-based attribution methods, including EigenCAM and Grad-CAM++. The prototype was evaluated in two formative case-study rounds with 16 participants. The thesis-focused analysis compared unaided hazard identification with an XAI-aided MR condition. Quantitative data included task completion time, simplified NASA-TLX-based workload scores, perceived situational awareness, and trust/reliability ratings; qualitative participant feedback and researcher observations were used to interpret usability and technical limitations.The results show that integrating AI-based hazard detection and local visual explanations into an MR interface is technically feasible at prototype level. However, the XAI-aided condition did not improve task completion time or average perceived situational awareness compared with unaided inspection. Across 13 valid paired timing observations, unaided inspection was consistently faster than the XAI-aided condition. Simplified NASA-TLX-based workload scores remained in the low-to-moderate range, but were higher for the XAI-aided condition than for the unaided baseline in the second round. Qualitative feedback nevertheless indicated that explanations could support interpretation and understanding when detections and explanations were correct, stable, and spatially readable.A central finding is that the usefulness of explainability in MR depends on the reliability and stability of the complete perception-explanation pipeline. Participants trusted explanations more strongly than the underlying hazard detections, while perceived system reliability was lower. Missed detections, misclassifications, disappearing overlays, delayed explanations, and interaction ambiguities reduced trust and limited practical usefulness. Explainability alone therefore cannot compensate for unreliable perception or unstable interface behaviour. This thesis contributes a working MR-XAI research prototype, formative evaluation knowledge on workload, perceived situational awareness, trust, and interaction challenges, and design implications for explainable MR systems in safety-critical environments. For the firefighting domain, the work highlights the potential of in-situ explanations to support hazard interpretation, while showing that robust detection, stable spatial presentation, low interaction burden, and clear uncertainty communication are prerequisites for operational relevance.
en
Additional information:
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft