中文

为何合成数据还不够真实:面向联系中心对话生成的诊断框架

计算与语言 2026-02-17 v2 人工智能

摘要

合成数据日益重要于联系中心,因为隐私限制和数据稀缺限制了真实对话的可用性。然而,生成用于下游应用的真实且有用的合成对话仍具有挑战性。在本工作中,我们在多个语言上对多种生成策略进行基准测试,这些策略受结构化监督指导下的通话属性(意图摘要、话题流程和质量保证(QA)表格)引导。为测试下游实用性,我们评估了合成转录文本在自动质量保证(AutoQA)任务上的表现,发现针对真实转录文本优化的提示 consistently 优于针对合成转录文本优化的提示。这些结果表明,当前的合成转录在捕捉真实经纪人-客户交互的完整真实性方面不足。为凸显这些下游差距,我们引入了一个包含 17 项指标的诊断评估框架,涵盖四个维度:(1)情感和情绪弧线,(2)语言复杂性,(3)交互风格,和(4)对话属性。我们的分析显示,即使有结构化监督,当前的生成策略在情感忠实度、不连贯性建模、行为变异和对话真实性方面仍表现出可测量的缺陷。总体而言,这些结果凸显了针对下游应用的合成对话生成的诊断性、指标驱动评估的重要性。

关键词

引用

@article{arxiv.2508.18210,
  title  = {Why Synthetic Isn't Real Yet: A Diagnostic Framework for Contact Center Dialogue Generation},
  author = {Rishikesh Devanathan and Varun Nathan and Ayush Kumar},
  journal= {arXiv preprint arXiv:2508.18210},
  year   = {2026}
}