中文

超出风格:RAG对语言变体的脆弱性

计算与语言 2026-01-28 v2

摘要

尽管检索增强生成(RAG)系统在 various NLP 基准测试中表现出色,但其在处理真实世界用户-LLM交互查询方面的鲁棒性仍大体未被探讨。这一问题对于实际部署构成了关键缺口,因为用户查询呈现出更大的语言变体,可能在相互依赖的RAG组件之间引发级联错误。本文系统性地分析了四种语言维度(正式性、可读性、礼貌性和语法正确性)对RAG性能的影响。我们评估了两种检索模型和九个LLM(参数规模从30亿到720亿),在四个信息寻求问答(QA)数据集上进行测试。我们的结果表明,语言改写显著影响检索和生成阶段,导致对较不正式查询的Recall@5分数下降最高可达40.41%,包含语法错误查询的答案匹配分数下降最高可达38.86%。值得注意的是,RAG系统对此类变体的敏感性高于仅使用的LLM生成,凸显了由于语言偏移导致的脆弱性。这些发现凸显了需要改进鲁棒性技术以提高多样化用户交互可靠性的必要性。代码已公开于https://github.com/Springcty/RAG-fragility-to-linguistic-variation。

关键词

引用

@article{arxiv.2504.08231,
  title  = {Out of Style: RAG's Fragility to Linguistic Variation},
  author = {Tianyu Cao and Neel Bhandari and Akhila Yerukola and Akari Asai and Maarten Sap},
  journal= {arXiv preprint arXiv:2504.08231},
  year   = {2026}
}

备注

Accepted to EACL 2026 (Main Conference)