Milicevic, A. D. (2026). Matrix-variate statistical methods for noise filtering and dimension reduction of GCxGC-MS data [Diploma Thesis, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.138684
E105 - Institut für Stochastik und Wirtschaftsmathematik
-
Date (published):
2026
-
Number of Pages:
91
-
Keywords:
GC×GC–MS; Mass Spectrometry; GC×GC–MS Data Preprocessing; Tensor Data Analysis; m; z Layer Analysis; Matrix Mahalanobis Distance; Kronecker Covariance Structure; Background Noise Detection; Tensor Principal Component Analysis
en
Abstract:
Diese Arbeit entwickelt einen Vorverarbeitungs-Workflow für Daten aus der umfassenden zweidimensionalen Gaschromatographie gekoppelt mit Massenspektrometrie (GC×GC–MS), der strukturiertes Hintergrundrauschen adressiert, ohne die RT1×RT2-Struktur aufzugeben. Jede Probe wird als Tensor dritter Ordnung X ∈ R^(I×J×K) dargestellt, dessen m/z-Slices matrixwertige RT1×RT2-Schichten sind. Die schichtweise Betrachtung erlaubt den Einsatz matrixvariater Statistik: Eine Matrix-Mahalanobis-Distanz, berechnet unter einer Kronecker-strukturierten Zeilen-/Spaltenkovarianz, die mit dem Dutilleul-Flip-Flop-MMLE geschätzt wird, bewertet jede Schicht hinsichtlich ausreißerähnlichen Verhaltens. Ein Chi-Quadrat-Referenzschwellenwert lokalisiert anschließend eine Kandidatenmenge von hintergrunddominierten Kanälen. Der Ersatz einer markierten Schicht wird als separate Entscheidung behandelt: Sie kann auf Null gesetzt, durch ein getrimmtes Nachbarmittel naheliegender m/z-Kanäle ersetzt oder unverändert belassen werden, wobei die Wahl durch visuelle Inspektion und nicht allein durch den Score bestimmt wird.Der Workflow wird an 30 Kraftstoffproben aus vier Kraftstoffklassen evaluiert. Vier Bereinigungsvarianten — roh, Auto-Zero, Auto-Trimmed und eine analystengeführte Variante (processed) — werden verglichen, indem der resultierende vierdimensionale Tensor (RT1×RT2×m/z×samples) mit dem Paket tensorBSS mittels Tensor-PCA zerlegt wird. Der Matrix-Mahalanobis-Schritt lokalisiert über alle Proben hinweg konsistent eine kleine feste Menge von m/z-Kanälen. Die Entscheidung innerhalb dieser Menge, ob eine Schicht genullt, durch ein getrimmtes Nachbarmittel ersetzt oder beibehalten wird, bleibt jedoch proben- und kanalspezifisch und kann nicht allein aus dem Score rekonstruiert werden. Im Vergleich zu den einheitlichen automatischen Regeln verschiebt die analystengeführte Variante die dominanten tPCA-Ladungen weg vom wiederkehrenden niedrigmassigen Hintergrundband hin zu m/z-Kanälen, die bewusst beibehalten wurden, während die Replikatkonsistenz im Score-Raum erhalten bleibt. Als zusätzlicher Nachweis für die Übertragbarkeit wird dasselbe automatische Screening mit anschließender Tensoranalyse auch auf einen zweiten, kleineren Datensatz mit 15 Messungen angewandt, eine C1474-Konzentrationsreihe, die mit einem anderen Instrument aufgenommen wurde. Eine leichtgewichtige interaktive Anwendung ergänzt die statistische Pipeline und unterstützt die schichtweise Inspektion pro Probe, die Überprüfung der Schwellenwerte und den direkten Vergleich verschiedener Bereinigungsoptionen.
de
This thesis develops a preprocessing workflow for comprehensive two-dimensional gas chromatography coupled with mass spectrometry (GC×GC–MS) data that targets structured background noise without flattening the chromatographic plane. Each sample is represented as a third-order tensor X ∈ R^(I×J×K) whose m/z-mode slices are matrix-valued RT1×RT2 layers. Working at the layer level enables the use of matrix-variate statistics: a matrix Mahalanobis distance, computed under a Kronecker-structured row/column covariance estimated by the Dutilleul flip-flop MMLE, scores each layer for outlier-like behaviour, and a chi-squared reference threshold localizes a candidate set of background-dominated channels. The replacement of a flagged layer is treated as a separate decision: a layer may be set to zero, replaced by a trimmed-neighbour mean of nearby m/z channels, or left untouched, with the choice guided by visual inspection rather than by the score alone.The workflow is evaluated on 30 fuel samples spanning four fuel classes. Four cleaning variants—raw, auto-zero, auto-trimmed, and an analyst-guided variant (processed)—are compared by feeding the resulting four-dimensional tensor (RT1×RT2×m/z×samples) into a tensor PCA decomposition computed with the tensorBSS package. The matrix Mahalanobis step consistently localizes a small fixed set of m/z channels across all samples, but the within-set decision to zero, trimmed-neighbour-replace, or retain a layer is sample- and channel-specific and cannot be recovered from the score alone. Compared with the uniform automatic rules, the analyst-guided variant moves the dominant tPCA loadings off the recurrent low-mass background band and onto m/z channels that the analyst preferred to retain, while preserving replicate consistency in the score space. As an additional check that the approach is not specific to one instrument or sample type, the same automatic screening and tensor analysis are also applied to a second, smaller dataset of 15 measurements (a C1474 concentration series acquired on a different instrument). A lightweight interactive application accompanies the statistical pipeline and supports per-sample layer inspection, threshold review, and side-by-side comparison of cleaning options.
en
Additional information:
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft Abweichender Titel nach Übersetzung der Verfasserin/des Verfassers