中文

一种使用GPT-4的二维零样本对话状态跟踪评估方法

计算与语言 2024-06-18 v1

摘要

对话状态跟踪(DST)通过精确匹配方法进行评估,这些方法依赖大量标注数据,并忽略语义一致性,导致过度评估。目前,利用大型语言模型(LLM)评估自然语言处理任务已取得可喜成果。然而,使用LLM进行DST评估仍处于探索阶段。在本文中,我们提出了一种使用GPT-4的二维零样本DST评估方法,将评估分为两个维度:准确性和完整性。此外,我们还在提示中设计了两种手动推理路径,以进一步提高评估的准确性。实验结果表明,我们的方法相比基线取得了更好的性能,并且与传统的基于精确匹配的方法一致。

关键词

引用

@article{arxiv.2406.11651,
  title  = {A Two-dimensional Zero-shot Dialogue State Tracking Evaluation Method using GPT-4},
  author = {Ming Gu and Yan Yang},
  journal= {arXiv preprint arXiv:2406.11651},
  year   = {2024}
}