面向工业级 RAG 的忠实性:基于加强协同适应框架的广告 QA
计算与语言
2026-02-27 v1
摘要
工业广告问答 (question answering, QA) 是高风险任务,幻觉内容(尤其是虚构 URL)可能导致财务损失、合规违规和法律风险。虽然检索增强生成 (Retrieval-Augmented Generation, RAG) 被广泛采用,但在实际部署中仍面临挑战,因为工业知识本质上是关联式的、频繁更新的,且与生成目标对齐不足。我们提出了一个加强协同适应框架,联合优化检索和生成,包含两个组成部分:(1) 图感知检索 (GraphRAG),通过建模高引用知识子图的实体-关系结构,用于多跳、领域特定的证据选择;(2) 基于组相对策略优化 (Group Relative Policy Optimization, GRPO) 的证据约束强化学习,奖励维度涵盖忠实性、风格合规、安全性和 URL 有效性。我们在内部广告 QA 数据集上进行实验,显示在专家评估的各个维度(包括准确性、完整性和安全性)上均实现一致提升,同时将幻觉率降低 72%。两周的在线 A/B 测试显示,点赞率提升 28.6%,点踩率下降 46.2%,URL 幻觉率降低 92.7%。该系统已在生产环境中运行超过半年,已服务数百万次 QA 交互。
引用
@article{arxiv.2602.22584,
title = {Towards Faithful Industrial RAG: A Reinforced Co-adaptation Framework for Advertising QA},
author = {Wenwei Li and Ming Xu and Tianle Xia and Lingxiang Hu and Yiding Sun and Linfang Shang and Liqun Liu and Peng Shu and Huan Yu and Jie Jiang},
journal= {arXiv preprint arXiv:2602.22584},
year = {2026}
}