Kunerth, P. (2026). Evaluating Extraction-Based RAG: A Systematic Assessment of VerbatimRAG on the CLAPNQ Benchmark [Diploma Thesis, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.140323
E194 - Institut für Information Systems Engineering
-
Date (published):
2026
-
Number of Pages:
86
-
Keywords:
Retrieval-Augmented Generation; Extraction-based QA; Long-form Question Answering; Faithfulness; Information Retrieval; Natural Language Processing; Benchmark Evaluation; ROUGE
en
Abstract:
Extraktionsbasierte Retrieval-Augmented-Generation-Systeme (RAG) reduzieren Halluzinationen, indem sie Antworten ausschließlich auf wörtliche Textauszüge aus abgerufenen Dokumenten stützen. Diese Arbeit präsentiert eine systematische Evaluierung von VerbatimRAG, einem solchen System, auf dem CLAPNQ-Benchmark, der speziell für die Evaluierung von RAG-Systemen bei der Beantwortung von Fragen mit langen Antworten entwickelt wurde.Die Evaluierung umfasst alle drei Stufen der RAG-Pipeline: Retrieval, Generierung mit Gold-Passagen und die vollständige End-to-End-Leistung. In der Gold-Passage-Einstellung erreicht VerbatimRAG einen ROUGE-L-Wert von 57,2 und erreicht damit sogar den stärksten feinabgestimmten Baseline, ohne aufgabenspezifisches Training zu benötigen. Im End-to-End-Setting sinkt die Leistung aller Systeme. VerbatimRAG liegt dabei leicht unter der stärksten generativen Baseline, da es Retrieval-Fehler nicht durch Generierung ausgleichen kann.Darüber hinaus evaluieren wir die Qualität zweier Extraktionsmethoden anhand der satzbasierten Relevanzannotationen von CLAPNQ und erstellen einen neuen Datensatz manuell erstellter Span-Annotationen für 100 CLAPNQ-Beispiele. Eine erneute Evaluierung mit diesen Annotationen zeigt, dass beide Extraktoren eher auf Satzebene operieren als minimale Spans zurückzugeben, was erklärt, warum der Wechsel zu präziseren Annotationen die Ergebnisse nicht wesentlich verbessert.Abschließend zeigt ein systematischer qualitativer Vergleich, dass VerbatimRAG quellentreuere und präzisere Antworten liefert als eine starke generative Baseline, jedoch schlechter bei Vollständigkeit und Kohäsion abschneidet. Die Ergebnisse zeigen, dass extraktionsbasierte RAG-Systeme einen vielversprechenden Ansatz darstellen, wenn Quelltreue und Nachvollziehbarkeit im Vordergrund stehen. Gleichzeitig bringt der extraktionsbasierte Ansatz grundsätzliche Einschränkungen hinsichtlich sprachlicher Flüssigkeit und Robustheit gegenüber Retrieval-Fehlern mit sich.Der gesamte Code und die Ergebnisse sind öffentlich verfügbar unter https://github.com/phlpknrth/verbatimrag-clapnq-eval.
de
Extraction-based Retrieval-Augmented Generation (RAG) systems reduce hallucinations by grounding answers directly in text taken from retrieved documents. This thesis presents a systematic evaluation of VerbatimRAG, an extraction-based RAG system, using the CLAPNQ benchmark for long-form question answering. The evaluation covers all three stages of the RAG pipeline: retrieval, generation with gold passages, and full end-to-end performance. In the gold passage setting, VerbatimRAG achieves a ROUGE-L score of 57.2.This result matches the strongest fine-tuned baseline, eventhough VerbatimRAG uses no task-specific training. In the end-to-endsetting, performance drops for all systems. VerbatimRAG performs slightly worse than the strongest generative baseline in this setting because it cannot correct retrieval errors through generation.The thesis also evaluates two extraction methods using CLAPNQ’ssentence-level relevance annotations and introduces a new set of manually created span-level annotations for 100 examples. Are-evaluation using these annotations shows that both extractors often return full sentences instead of minimal spans. This explains why using more fine-grained ground truth does not lead to much better evaluationscores.Finally, a systematic qualitative comparison shows that VerbatimRAGproduces more faithful and more concise answers than a strong generative baseline. At the same time, it performs worse on completeness and cohesiveness. Overall, the results suggest that extraction-basedRAG is a suitable approach when faithfulness and traceability are important, but that it has clear limitations in fluency and in handling retrieval errors.All code and results are publicly available at https://github.com/phlpknrth/verbatimrag-clapnq-eval.
en
Additional information:
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft Abweichender Titel nach Übersetzung der Verfasserin/des Verfassers