中文

迈向大语言模型驱动的对话状态跟踪

计算与语言 2023-10-24 v1

摘要

对话状态跟踪(DST)对于确保面向任务对话系统中用户目标与系统动作的准确跟踪至关重要。诸如GPT3和ChatGPT等大语言模型(LLMs)的出现,引发了对其在多样应用中效能的广泛关注。在本研究中,我们对ChatGPT在DST中的能力进行了初步考察。我们的评估揭示了ChatGPT在此任务上的卓越表现,为研究者提供了关于其能力的宝贵见解,并为对话系统的设计与增强提供了有用方向。尽管表现令人印象深刻,ChatGPT仍有显著局限,包括其闭源性质、请求限制、引发的数据隐私担忧以及缺乏本地部署能力。为应对这些关切,我们提出LDST,一种基于较小开源基础模型的LLM驱动DST框架。通过采用新颖的域-槽指令微调方法,LDST取得了与ChatGPT相当的性能。在三种不同实验设定下的综合评估中,我们发现LDST在零样本与少样本设定下相较先前SOTA方法均展现出显著的性能提升。为可复现性提供了源代码。

关键词

引用

@article{arxiv.2310.14970,
  title  = {Towards LLM-driven Dialogue State Tracking},
  author = {Yujie Feng and Zexin Lu and Bo Liu and Liming Zhan and Xiao-Ming Wu},
  journal= {arXiv preprint arXiv:2310.14970},
  year   = {2023}
}

备注

Accepted at EMNLP 2023