Negi, A. (2026). Multi-Label Recognition of Non-Rigid Characters in Video via Transfer Learning Using Deep Learning Architectures [Diploma Thesis, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.134364
E193 - Institut für Visual Computing and Human-Centered Technology
-
Date (published):
2026
-
Number of Pages:
95
-
Keywords:
Object Recognition; Audio Retrieval; Deep Learning
en
Abstract:
Bildklassifizierung und Objekterkennung sind seit Jahrzehnten aktive Forschungsgebiete, die sich von manuell entwickelten Methoden zur Merkmalsextraktion hin zu Deep-Learning-basierten Ansätzen entwickelt haben. Deep Learning hat diese Bereiche zwar revolutioniert, hat aber auch seine Nachteile. Deep-Learning-Methoden erfordern große Mengen an beschrifteten Trainingsdaten, was zeitaufwendig und kostspielig ist. Transfer Learning löst dieses Problem, indem es vortrainierte Gewichte aus Modellen nutzt, die bereits allgemeine Merkmale wie Formen, Texturen und Kanten gelernt haben, und diese auf kleineren domänenspezifischen Datensätzen feinabstimmt. Diese Arbeit untersucht die Auswirkungen von Transfer Learning auf die bildweise Multi-Label-Charaktererkennung in „The Muppet Show“, einer Fernsehserie mit einer Besetzung aus Puppenfiguren. Die Aufgabe besteht darin, zu bestimmen, welche der sechs Hauptfiguren – nämlich Kermit der Frosch, Miss Piggy, Fozzie Bär, Rowlf der Hund, Statler & Waldorf und der schwedische Koch – in jedem Einzelbild erscheinen, wobei mehrere Figuren gleichzeitig vorhanden sein können. Zunächst wird eine Auswahl von Backbone-Architekturen verglichen, um das beste Modell zu ermitteln. Dieses Modell wird anschließend einer Ablationsstudie unterzogen, um die Leistung zu optimieren, und schließlich wird eine qualitative Generalisierungsanalyse für ungesehene Episoden mittels Gradient-weighted Class-Activation Mapping (Grad-CAM) durchgeführt. Die Ergebnisse dieser Arbeit zeigen, dass Transfer Learning den größten Leistungsgewinn bringt und den durchschnittlichen Makro-mAP von 42,40% auf 74,75% erhöht, wobei weniger Trainingszeit benötigt wird als bei einem Training von Grund auf. CLIP-ViT-B/16 erwies sich als das leistungsstärkste Backbone und erzielte sowohl den höchsten macro-mAP als auch den geringsten Leistungsabfall bei Out-Of-Distribution-Episoden. Durch das Auftauen von zwei Encoder-Schichten und die Anwendung von Datenaugmentierung verbesserte sich der durchschnittliche macro-mAP auf 89,16%. Die Grad-CAM-Analyse zeigt ferner, dass das Modell für die meisten Figuren erfolgreich figurspezifische Unterscheidungsmerkmale gelernt hat, aber auch, dass szenengebundene Figuren wie Statler & Waldorf und der schwedische Koch manchmal anhand ihrer Hintergrundumgebung erkannt werden. Insgesamt zeigt diese Arbeit, dass Transfer Learning eine effektive Charaktererkennung auf einem begrenzten Muppet-Show-Datensatz ermöglicht, eine wirklich robuste Generalisierung jedoch durch die Vielfalt des Trainingsmaterials eingeschränkt bleibt.
de
Image classification and object detection have been active research areas for decades, evolved from manually designed feature extraction methods to deep learning based approaches. While Deep Learning has revolutionized these fields, it also has its drawbacks. Deep Learning methods require a huge amount of labeled training data, which is time consuming and costly. Transfer Learning addresses this problem, by utilizing pre-trained weights from models that have already learned general features, such as shapes, textures and edges and fine-tuning them on smaller domain-specific datasets. This thesis investigates the effects of transfer learning on frame-wise multi-label character recognition of "The Muppet Show", a TV series featuring a cast of puppet characters. The task is to determine which of the six main characters, namely Kermit The Frog, Miss Piggy, Fozzie Bear, Rowlf The Dog, Statler & Waldorf and The Swedish Chef, appear in each frame, where multiple characters can be present simultaneously. First, a selection of backbone architectures is compared to identify the best model. This model then undergoes an ablation study to further optimize performance and finally a qualitative generalization analysis on unseen episodes is conducted using Gradient-weighted Class-Activation Mapping (Grad-CAM). The results of this thesis show that transfer learning provides the single largest performance gain, increasing the average macro-mAP from 42.40% to 74.75% with less training time required than training from scratch. CLIP-ViT-B/16 proved to be the best-performing backbone, achieving the highest macro-mAP, as well as the lowest performance loss on Out-Of-Distribution episodes. Unfreezing two encoder layers and applying data augmentation improved the average macro-mAP to 89.16%. The Grad-CAM analysis further reveals that the model successfully learned character-specific discriminative features for most characters, but also shows that setting-bound characters such as Statler & Waldorf and the Swedish Chef are sometimes detected through their background environment. Overall, this work demonstrates that transfer learning enables effective character recognition on a limited Muppet Show dataset, but truly robust generalization remains constrained by the diversity of the training material.
en
Additional information:
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft