FECT:面向联系中心对话转录本中解释性 AI 生成主张的事实性评估
计算与语言
2025-08-05 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 已知会产生幻觉,生成不基于输入、参考材料或真实世界知识的自然语言输出。在企业应用中,AI 功能支持业务决策时,这类幻觉尤其有害。分析和总结联系中心对话的 LLM 引入了事实性评估的独特挑战,因为关于捕获在对话中情感及业务问题根本原因的分析性解释通常不存在真实标签。为此,我们首先引入一个3D范式——分解 (Decompose)、解耦 (Decouple)、分离 (Detach)——用于人工标注指南和 LLM 判官提示中,将事实性标签 grounded 在语言学化评估标准中。随后,我们提出了FECT,即面向联系中心对话转录本中解释性 AI 生成主张事实性评估的新基准数据集,在3D范式下进行标注。最后,我们报告了在3D范式下对 LLM 判官进行对齐的结果。总体而言,我们的发现为自动评估分析联系中心对话的 AI 系统生成的输出事实性提供了新方法。
引用
@article{arxiv.2508.00889,
title = {FECT: Factuality Evaluation of Interpretive AI-Generated Claims in Contact Center Conversation Transcripts},
author = {Hagyeong Shin and Binoy Robin Dalal and Iwona Bialynicka-Birula and Navjot Matharu and Ryan Muir and Xingwei Yang and Samuel W. K. Wong},
journal= {arXiv preprint arXiv:2508.00889},
year = {2025}
}
备注
Accepted for an oral presentation at Agentic & GenAI Evaluation KDD 2025: KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models