<div class="csl-bib-body">
<div class="csl-entry">Kunerth, P. (2026). <i>Evaluating Extraction-Based RAG: A Systematic Assessment of VerbatimRAG on the CLAPNQ Benchmark</i> [Diploma Thesis, Technische Universität Wien]. reposiTUm. https://doi.org/10.34726/hss.2026.140323</div>
</div>
-
dc.identifier.uri
https://doi.org/10.34726/hss.2026.140323
-
dc.identifier.uri
http://hdl.handle.net/20.500.12708/229241
-
dc.description
Arbeit an der Bibliothek noch nicht eingelangt - Daten nicht geprüft
-
dc.description
Abweichender Titel nach Übersetzung der Verfasserin/des Verfassers
-
dc.description.abstract
Extraktionsbasierte Retrieval-Augmented-Generation-Systeme (RAG) reduzieren Halluzinationen, indem sie Antworten ausschließlich auf wörtliche Textauszüge aus abgerufenen Dokumenten stützen. Diese Arbeit präsentiert eine systematische Evaluierung von VerbatimRAG, einem solchen System, auf dem CLAPNQ-Benchmark, der speziell für die Evaluierung von RAG-Systemen bei der Beantwortung von Fragen mit langen Antworten entwickelt wurde.Die Evaluierung umfasst alle drei Stufen der RAG-Pipeline: Retrieval, Generierung mit Gold-Passagen und die vollständige End-to-End-Leistung. In der Gold-Passage-Einstellung erreicht VerbatimRAG einen ROUGE-L-Wert von 57,2 und erreicht damit sogar den stärksten feinabgestimmten Baseline, ohne aufgabenspezifisches Training zu benötigen. Im End-to-End-Setting sinkt die Leistung aller Systeme. VerbatimRAG liegt dabei leicht unter der stärksten generativen Baseline, da es Retrieval-Fehler nicht durch Generierung ausgleichen kann.Darüber hinaus evaluieren wir die Qualität zweier Extraktionsmethoden anhand der satzbasierten Relevanzannotationen von CLAPNQ und erstellen einen neuen Datensatz manuell erstellter Span-Annotationen für 100 CLAPNQ-Beispiele. Eine erneute Evaluierung mit diesen Annotationen zeigt, dass beide Extraktoren eher auf Satzebene operieren als minimale Spans zurückzugeben, was erklärt, warum der Wechsel zu präziseren Annotationen die Ergebnisse nicht wesentlich verbessert.Abschließend zeigt ein systematischer qualitativer Vergleich, dass VerbatimRAG quellentreuere und präzisere Antworten liefert als eine starke generative Baseline, jedoch schlechter bei Vollständigkeit und Kohäsion abschneidet. Die Ergebnisse zeigen, dass extraktionsbasierte RAG-Systeme einen vielversprechenden Ansatz darstellen, wenn Quelltreue und Nachvollziehbarkeit im Vordergrund stehen. Gleichzeitig bringt der extraktionsbasierte Ansatz grundsätzliche Einschränkungen hinsichtlich sprachlicher Flüssigkeit und Robustheit gegenüber Retrieval-Fehlern mit sich.Der gesamte Code und die Ergebnisse sind öffentlich verfügbar unter https://github.com/phlpknrth/verbatimrag-clapnq-eval.
de
dc.description.abstract
Extraction-based Retrieval-Augmented Generation (RAG) systems reduce hallucinations by grounding answers directly in text taken from retrieved documents. This thesis presents a systematic evaluation of VerbatimRAG, an extraction-based RAG system, using the CLAPNQ benchmark for long-form question answering. The evaluation covers all three stages of the RAG pipeline: retrieval, generation with gold passages, and full end-to-end performance. In the gold passage setting, VerbatimRAG achieves a ROUGE-L score of 57.2.This result matches the strongest fine-tuned baseline, eventhough VerbatimRAG uses no task-specific training. In the end-to-endsetting, performance drops for all systems. VerbatimRAG performs slightly worse than the strongest generative baseline in this setting because it cannot correct retrieval errors through generation.The thesis also evaluates two extraction methods using CLAPNQ’ssentence-level relevance annotations and introduces a new set of manually created span-level annotations for 100 examples. Are-evaluation using these annotations shows that both extractors often return full sentences instead of minimal spans. This explains why using more fine-grained ground truth does not lead to much better evaluationscores.Finally, a systematic qualitative comparison shows that VerbatimRAGproduces more faithful and more concise answers than a strong generative baseline. At the same time, it performs worse on completeness and cohesiveness. Overall, the results suggest that extraction-basedRAG is a suitable approach when faithfulness and traceability are important, but that it has clear limitations in fluency and in handling retrieval errors.All code and results are publicly available at https://github.com/phlpknrth/verbatimrag-clapnq-eval.
en
dc.language
English
-
dc.language.iso
en
-
dc.rights.uri
http://rightsstatements.org/vocab/InC/1.0/
-
dc.subject
Retrieval-Augmented Generation
en
dc.subject
Extraction-based QA
en
dc.subject
Long-form Question Answering
en
dc.subject
Faithfulness
en
dc.subject
Information Retrieval
en
dc.subject
Natural Language Processing
en
dc.subject
Benchmark Evaluation
en
dc.subject
ROUGE
en
dc.title
Evaluating Extraction-Based RAG: A Systematic Assessment of VerbatimRAG on the CLAPNQ Benchmark
en
dc.type
Thesis
en
dc.type
Hochschulschrift
de
dc.rights.license
In Copyright
en
dc.rights.license
Urheberrechtsschutz
de
dc.identifier.doi
10.34726/hss.2026.140323
-
dc.contributor.affiliation
TU Wien, Österreich
-
dc.rights.holder
Philip Kunerth
-
dc.publisher.place
Wien
-
tuw.version
vor
-
tuw.thesisinformation
Technische Universität Wien
-
tuw.publication.orgunit
E194 - Institut für Information Systems Engineering
-
dc.type.qualificationlevel
Diploma
-
dc.identifier.libraryid
AC17915508
-
dc.description.numberOfPages
86
-
dc.thesistype
Diplomarbeit
de
dc.thesistype
Diploma Thesis
en
dc.rights.identifier
In Copyright
en
dc.rights.identifier
Urheberrechtsschutz
de
tuw.advisor.staffStatus
staff
-
tuw.advisor.orcid
0000-0001-5551-3100
-
item.languageiso639-1
en
-
item.cerifentitytype
Publications
-
item.fulltext
with Fulltext
-
item.openairecristype
http://purl.org/coar/resource_type/c_bdcc
-
item.openairetype
master thesis
-
item.openaccessfulltext
Open Access
-
item.grantfulltext
open
-
item.mimetype
application/pdf
-
crisitem.author.dept
E194-06 - Forschungsbereich Machine Learning
-
crisitem.author.parentorg
E194 - Institut für Information Systems Engineering