Burges, M. (2026). Object Detection in Remote Sensing - Interactive and Active Learning-based Approaches for Historical and Contemporary Imagery [Dissertation, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.145522
Fernerkundungsbilder liefern beispiellose Datenmengen für Erdbeobachtungsanwendungen, doch die Umwandlung dieser Daten in verwertbare Erkenntnisse bleibt durch die Geschwindigkeit der Annotation begrenzt. Das Spannungsfeld zwischen spezialisierter Fachexpertise und maschineller Skalierbarkeit stellt eine grundlegende Herausforderung für die Objektdetektion dar. Spezialisierte Objektkategorien erfordern erfahrene Annotatoren, deren Zeit begrenzt und teuer ist, was zu einer wachsenden Kluft zwischen verfügbaren und ausgewerteten Daten führt. Diese Arbeit entwickelt komplementäre Methoden für eine experteneffiziente Annotation in der optischen Fernerkundung und adressiert verschiedene Phasen der Annotations-Pipeline mithilfe interaktiver Detektion, Foundation Models, Active Learning und Explainability-Techniken. Die Arbeit befasst sich mit fünf Forschungsfragen. Die erste untersucht, ob interaktive Nutzerprompts, die in einen transformerbasierten Detektor eingebunden sind, die Detektionsergebnisse verbessern und wie diese Verbesserung mit der Anzahl der bereitgestellten Prompts skaliert. Die zweite analysiert, ob auf großen, allgemeinen Datensätzen vortrainierte Foundation Models eine bessere Übertragung auf historische Luftbilder ermöglichen als ein domänenspezifisches Pretraining und ob Vision Language Models historische Aufnahmen ohne Finetuning kategorisieren können. Die dritte prüft, ob eine auf Foundation Models basierende Active-Learning-Strategie für die Objekterkennung bessere Ergebnisse erzielt als etablierte Baselines. Die vierte evaluiert, ob eine ressourcenarme Explainability-Methode für transformerbasierte Detektoren genauere und räumlich präzisere Saliency Maps liefert als bestehende Verfahren und dabei nahezu in Echtzeit arbeitet. Die fünfte untersucht, ob sich die vorgeschlagenen interaktiven und Active- Learning-basierten Frameworks auf historische Luftbilder übertragen lassen, am Beispiel der Detektion von Bombenkratern aus dem Zweiten Weltkrieg. Zur Beantwortung dieser Fragen führt die Arbeit IRTDETR ein, ein interaktives Detektionsframework, das das gesamte Bild über einen Cross-Attention-Mechanismus mit den Eingaben des Annotators verknüpft und mit einem neuartigen Attention-Score- Similarity-Loss trainiert wird. Ferner werden Foundation Models für den Transfer auf spezialisierte Domänen evaluiert, eine Active-Learning-Strategie vorgestellt, die eine duale Unsicherheitsschätzung mit maskengeführter Diversitätsauswahl und einer Proposal Substitution kombiniert, sowie AC++, eine queryspezifische Explainability-Methode, die einen Decoder Attention Rollout mit gradientenbasierter Bounding-Box Attribution verbindet. Die empirische Evaluation auf mehreren Datensätzen zeigt erhebliche Effizienzsteigerungen bei der Annotation. Interaktive Annotation erreichte die in der User Study festgelegte Recall-Schwelle Schwelle 146% schneller als die manuelle Baseline und reduzierte die wahrgenommene kognitive Belastung in einer kontrollierten Nutzerstudie mit Domänenexperten um 27%. Die Active-Learning-Strategie übertraf bei gleichem Annotationsbudget auf fünf Datensätzen durchgängig sowohl die Zufallsauswahl als auch die bisherigen Baselines. Die Explainability-Methode erzielte in nahezu allen Konfigurationen die besten oder zweitbesten Werte für Faithfulness und Lokalisierung, bei der Evaluation auf fünf Datensätzen und zwei Detektorarchitekturen, und benötigte dabei etwa eine Sekunde pro Query auf einer einzelnen GPU. Die Analyse von Luftaufklärungsbildern aus dem Zweiten Weltkrieg zeigte, dass das Pretraining mit natürlichen Bildern trotz signifikanter visueller Unterschiede überraschend gut übertragbar ist, während die Zero-Shot-Kategorisierung mit Vision-Language-Modellen auf breite und visuell eindeutige Klassen beschränkt blieb. Auf der Bombenkraterdetektion ließ sich das Active Learning Framework nur eingeschränkt anwenden, da das zugrunde liegende Segmentierungs-Foundations-Modell keine zuverlässigen Proposals erzeugte. Die Beiträge zeigen, dass experteneffiziente Annotation komplementäre Ansätze erfordert, die unterschiedliche Phasen der Annotations-Pipeline adressieren. Interaktive Frameworks maximieren den Wert einzelner Annotationen, Foundation Models reduzieren die Abhängigkeit von großen annotierten Datensätzen, Active Learning priorisiert informative Bilder und reduziert primär den Annotationsaufwand, und Explainability schafft eine Grundlage für eine transparente Validierung in missionskritischen Anwendungen. Zusammen bieten diese Komponenten ein praktisches Werkzeug für Domänen, in denen Expertenwissen unverzichtbar ist, die Annotationsressourcen jedoch stark begrenzt sind.
de
Remotely sensed imagery provides unprecedented volumes of data for Earth observation applications, yet converting this data into actionable insights remains constrained by the efficiency of annotation. The expertise scalability tradeoff poses a fundamental challenge in object detection. Specialized object categories require expert annotators whose time is expensive and limited, creating a widening gap between the availability of data and labeled training data. This thesis develops complementary methods for expert, efficient annotation in optical remote sensing. It addresses different stages of the annotation pipeline through interactive detection, foundation models, active learning, and explainability techniques. The work addresses five research questions. The first asks whether interactive user prompts integrated into a transformer-based object detector improve detection results and how the improvement scales with the number of prompts provided. The second investigates whether feature-extracting foundation models pretrained on large general datasets transfer better to historical aerial imagery than domain-specific pretraining, and whether vision language models can categorize degraded historical imagery in a zero-shot setting. The third examines whether a foundation model-based active learning strategy for object detection can match or exceed established baselines under reduced annotation budgets. The fourth evaluates whether a lightweight explainability method for transformer-based detectors can produce more faithful, spatially precise saliency maps than existing approaches while remaining fast enough for near-real-time use. The fifth asks whether the proposed interactive and active learning frameworks transfer to historical aerial imagery under severe domain shift, with World War II bomb crater detection as the stress test case. To answer these questions, the thesis introduces IRTDETR. This interactive detection framework globally aligns the entire image with annotator inputs via a cross-attention mechanism and is trained with a novel attention-score similarity loss. It further evaluates foundation models for transfer learning to specialized domains, proposes an active learning strategy that combines dual-source uncertainty estimation with mask-guided diversity sampling and proposal substitution, and presents AC++. This query-specific explainability method combines decoder attention rollout with gradient-based boundingbox attribution. Empirical evaluation across multiple datasets demonstrates substantial gains in annotation efficiency. Interactive annotation reached the user study target recall 146% faster than the manual baseline and reduced perceived workload by 27% in a controlled user study with domain experts. The active learning strategy consistently outperformed random sampling and prior baselines at equal labeling budgets across five datasets, with mask-guided diversity providing the largest individual contribution. The explainability method achieved the best or near-best faithfulness and localization scores in nearly every configuration evaluated across five datasets and two detector architectures, while running at approximately one second per query on a single GPU. Evaluation on World War II aerial reconnaissance imagery showed that natural image pretraining transfers surprisingly well despite substantial visual differences. At the same time, zero-shot categorization with vision-language models remained limited to broad, visually distinct classes. The active learning framework only partially transferred to bomb crater detection because the underlying segmentation foundation model failed to produce reliable crater proposals. The contributions show that expert, efficient annotation requires complementary methods that address different stages of the pipeline. Interactive frameworks maximize the value of individual annotations, foundation models reduce dependence on large labeled datasets, active learning prioritizes informative samples and primarily reduces annotation effort, and explainability provides a basis for transparent validation in mission-critical applications. Together, these components form a practical toolkit for domains where expert knowledge is essential yet annotation resources are severely constrained.
en
Additional information:
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft Abweichender Titel nach Übersetzung der Verfasserin/des Verfassers