中文

迈向任务型对话流程的自动评估

计算与语言 2024-11-18 v1 人工智能

摘要

任务型对话系统依赖预定义的对话方案(对话流程),通常表示为有向无环图。这些流程可以手动设计,也可以从先前记录的对话中自动生成。由于领域专业知识的差异或依赖不同的先前对话集合,这些对话流程可能表现出显著不同的图结构。尽管它们很重要,但目前尚无评估对话流程质量的标准方法。我们提出了 FuDGE(模糊对话图编辑距离),这是一种新颖的指标,通过评估对话流程的结构复杂性和对对话数据的表示覆盖度来评估对话流程。FuDGE 测量单个对话与流程的对齐程度,从而衡量一组对话整体上被流程表示的程度。通过在手动配置的流程和自动化技术生成的流程上进行大量实验,我们证明了 FuDGE 及其评估框架的有效性。通过标准化和优化对话流程,FuDGE 使对话设计师和自动化技术能够实现更高水平的效率和自动化。

关键词

引用

@article{arxiv.2411.10416,
  title  = {Towards Automatic Evaluation of Task-Oriented Dialogue Flows},
  author = {Mehrnoosh Mirtaheri and Nikhil Varghese and Chandra Khatri and Amol Kelkar},
  journal= {arXiv preprint arXiv:2411.10416},
  year   = {2024}
}