中文

通过函数调用将大语言模型作为零样本对话状态跟踪器

计算与语言 2024-05-31 v4 人工智能

摘要

由于大语言模型(LLM)在一般语境下具有先进的理解与生成能力,它们在对话系统中日益普及。然而,它们在任务型对话(TOD)中的有效性仍然不尽如人意,因为 TOD 不仅需要生成回复,还需要在特定任务和领域内进行有效的对话状态跟踪(DST)。在本工作中,我们提出了一种新方法 FnCTOD,通过函数调用利用 LLM 来解决 DST 问题。该方法改进了零样本 DST,能够适应多样化领域而无需大量数据收集或模型微调。我们的实验结果表明,该方法在中等规模的开源 LLM 和专有 LLM 上均取得了出色的性能:通过上下文提示,它使各种 7B 或 13B 参数模型超越了先前由 ChatGPT 创造的最先进水平(SOTA),并提升了 ChatGPT 的性能,以 5.6% 的平均联合目标准确率(JGA)优势击败了 SOTA。GPT-3.5 和 GPT-4 的单模型结果分别提升了 4.8% 和 14%。我们还表明,通过在一小部分多样化的任务型对话上进行微调,我们可以为中等规模模型(特别是 13B 参数的 LLaMA2-Chat 模型)配备函数调用能力,使其 DST 性能可与 ChatGPT 媲美,同时保持其聊天能力。我们已在 https://github.com/facebookresearch/FnCTOD 公开代码。

关键词

引用

@article{arxiv.2402.10466,
  title  = {Large Language Models as Zero-shot Dialogue State Tracker through Function Calling},
  author = {Zekun Li and Zhiyu Zoey Chen and Mike Ross and Patrick Huber and Seungwhan Moon and Zhaojiang Lin and Xin Luna Dong and Adithya Sagar and Xifeng Yan and Paul A. Crook},
  journal= {arXiv preprint arXiv:2402.10466},
  year   = {2024}
}

备注

ACL 2024 Main. Code available at: https://github.com/facebookresearch/FnCTOD