Qwen Goes Brrr:面向乌克兰语多域文档理解的即插即用检索增强生成
计算与语言
2026-05-12 v1 人工智能
信息检索
机器学习
摘要
我们参加了第五届 UNLP 共享任务,系统需从 PDF 文档集合中回答乌克兰语多选题,并定位支撑文档及页码。我们提出基于检索增强的管道,包含三大思想:PDF 的语境分块、问题感知的稠密检索以及基于问题和答案选项的重排序,以及从小型重排序 passages 中受约束的答案生成。最终系统使用 Qwen3-Embedding-8B 进行检索,采用经微调的 Qwen3-Reranker-8B 进行 passage 排序,使用 Qwen3-32B 进行答案选择。在 held-out 数据集上,重排序将 Recall@1 提升至 0.7935(原 0.6957),而使用前 2 个重排序 passages 可将答案准确率提升至 0.9674(原 0.9348)。我们的最佳模型在公开榜单上取得 0.9452,在私人榜单上达到 0.9598。我们的实验表明,在严格的代码竞赛约束下,保持文档结构并使相关性估计意识到答案空间,比增加复杂的下游启发式方法更为有效。
引用
@article{arxiv.2605.10296,
title = {Qwen Goes Brrr: Off-the-Shelf RAG for Ukrainian Multi-Domain Document Understanding},
author = {Anton Bazdyrev and Ivan Bashtovyi and Ivan Havlytskyi and Oleksandr Kharytonov and Artur Khodakovskyi},
journal= {arXiv preprint arXiv:2605.10296},
year = {2026}
}
备注
Accepted to The Fifth Ukrainian Natural Language Processing Conference (UNLP 2026)