Moser, L. (2026). User Behavior Simulation with Large Language Models for Security Evaluation [Diploma Thesis, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.132647
Öffentlich verfügbare und korrekt gelabelte Logdaten für die Evaluierung von Intrusion Detection-Systemen sind derzeit nur in begrenztem Umfang verfügbar. Um dieser Einschränkung zu begegnen und über rein regelbasierte Testbed-Ansätze hinauszugehen, wird in dieser Arbeit ein leistungsfähiger KI-basierter Systemadministrator-Agent entwickelt. Der Agent verfügt über Fähigkeiten zur Browser-Interaktion, zur Bearbeitung von Dateien sowie zur Ausführung von Kommandozeilenbefehlen. Die zugrunde liegende Architektur folgt einem ReAct-basierten Ansatz, bei dem der Agent iterativ geeignete Werkzeuge auswählt, um menschenähnliche Systemadministrationsaufgaben auszuführen, und eigenständig entscheidet, wann die Aufgabe erfolgreich abgeschlossen ist. In einer kontrollierten Umgebung führen sowohl der KI-Agent als auch menschliche Teilnehmer vordefinierte Troubleshooting-Szenarien durch, wodurch ein gelabelter Logdatensatz entsteht. Anschließend werden in dieser Arbeit verschiedene Evaluationsmethodenangewendet, basierend auf einfachen statistischen Merkmalen sowie Techniken des maschinellen Lernens, um zu untersuchen, wie stark KI-generierte Logs menschlich generierten Logs ähneln und in welchem Ausmaß verbleibende Unterschiede identifiziert werden können. Die Auswertung zeigt, dass bereits einfache Modelle wie Support-Vector-Machines menschlich und KI-generierte Logs zuverlässig voneinander unterscheiden können. Deep-Learning Modelle übertreffen diese Ansätze im untersuchten Setting nicht. Die höchsten erreichtenMacro-F1-Werte betragen 0,71 für Audit-Logs, 0,70 für Applikationslogs und 0,72 für Syslog-Daten. Permutationstests mit zufällig neu zugewiesenen Akteurs Labels bestätigen, dass die Klassifikatoren tatsächliche Unterschiede erfassen und nicht lediglich zufällige Strukturen ausnutzen. Darüber hinaus zeigt die Analyse systematische Unterschiede im zeitlichen Verhalten, in der Kommandoverwendung, in Event-Verteilungen sowie in Unigramm-Statistiken zwischen menschlich und KI-generierten Logs. Diese Arbeit liefert Einblicke in die Eigenschaften von KI-generiertem Systemverhalten und zeigt Ansatzpunkte zur Verbesserung des Agentendesigns für die Generierung und Evaluierung von Logdaten auf. Obwohl Unterschiede identifiziert werden können, deuten die Ergebnisse darauf hin, dass die generierten Logs bereits wesentliche Merkmale menschlichen Verhaltens abbilden und somit ein nicht-triviales Maß an Realismus erreichen.
de
Currently, only limited publicly available and correctly labeled log data exists for the evaluation of intrusion detection systems. To address this limitation and move beyond rule-based testbed approaches, this work implements a highly capable AI-based system administrator agent with browser, file-editing, and command-line interaction capabilities. The architecture follows a ReAct-style agent design, where the agent iteratively selects tools to perform human-like system administration tasks and autonomously decides when to terminate. In a controlled environment, both the AI agent and human participants execute predefined troubleshooting scenarios, resulting in a labeled log dataset. This work then applies arrange of evaluation methods, based on simple statistical features and machine learning techniques, to evaluate how closely AI-generated logs resemble human-generated logs and to what extent remaining differences can be identified. The results show that simple models, such as support vector machines, effectively distinguish between human and AI-generated logs. Deep learning models do not outperform these approaches within the investigated setting. The highest achieved macro-F1 scores are 0.71 for audit logs, 0.70 for application logs, and 0.72 for syslog data. Permutation tests with randomly reassigned actor labels confirm that the classifiers capture genuine differences rather than random structure. In addition, the analysis reveals systematic differences in temporal behavior, command usage, event distributions, and unigram statistics between human and AI-generated logs. This work provides insights into the characteristics of AI-generated system behavior and highlights directions for improving AI-agent design for log data generation and evaluation. While differences can be detected, the results indicate that the generated logs already capture several characteristics of human behavior, suggesting a non-trivial level of realism.
en
Additional information:
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft