中文

从通话记录到 AI 代理:知识抽取、RAG 集成与对话式 AI助手的稳健评估

计算与语言 2026-02-19 v1

摘要

为客户导向行业构建可靠的对话式 AI 助手仍富含挑战,主要因噪声对话数据、碎片化知识以及对准确人工转接的需求——尤其是那些高度依赖实时信息的领域。本文提出了一个从历史通话记录中直接构建和评估对话式 AI 助手的端到端框架。首先,对 incoming 通话记录采用简化版 PIPA 框架进行评分,聚焦于观察对齐与恰当响应行为,筛选出高质量的交互,确保其具有连贯的流程和有效的人工客服响应。随后,使用大型语言模型(LLM)从精选的通话记录中抽取结构化知识,并部署于检索增强生成(RAG)管道中作为唯一的 grounding source。通过系统化的提示调优控制助手行为,逐步从单一提示转向精简、模块化且受控的设计,以确保一致性、安全性和可控执行。评估采用基于通话记录的仿真用户进行,量化衡量通话覆盖率、事实准确性和人工升级行为。额外的红队测试评估对抗提示注入、超出范围及超出上下文攻击的鲁棒性。在房地产和专业招聘领域进行实验,这些领域本意就具有挑战性且当前自动化程度不足,因其依赖实时数据。尽管面临这些限制,该助手能够自主处理约30%的通话,实现近乎完美的事实准确性和拒绝行为,并在对抗性测试下展现出强大的鲁棒性。

关键词

引用

@article{arxiv.2602.15859,
  title  = {From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants},
  author = {Krittin Pachtrachai and Petmongkon Pornpichitsuwan and Wachiravit Modecrua and Touchapon Kraisingkorn},
  journal= {arXiv preprint arXiv:2602.15859},
  year   = {2026}
}

备注

9 pages, 2 figures, 1 table