中文

通过双低秩适应实现零样本跨域对话状态追踪

计算与语言 2024-08-01 v1

摘要

零样本对话状态追踪(DST)旨在使对话系统能够在无需人工标注或大量重新训练的情况下迁移至不熟悉的领域。先前的研究通过将提示嵌入语言模型(LM)来实现这一目标。常见的方法包括在输入层集成提示,或在每个Transformer层引入可学习变量。然而,每种策略都有其固有局限。在输入层集成的提示可能被低效利用,其影响可能在连续的Transformer层中逐渐减弱。相反,向每层添加可学习变量可能会使训练过程复杂化并增加推理延迟。为了解决上述问题,本文提出了双低秩适应(DualLoRA),一种用于零样本DST的即插即用架构。DualLoRA包含两个不同的低秩适应(LoRA)组件,分别针对对话上下文处理和提示优化,以确保提示在整个Transformer模型层中的全面影响。这在不增加额外推理延迟的情况下实现,展示了高效集成到现有架构中的能力。通过在MultiWOZ和SGD数据集上的严格评估,DualLoRA在零样本设置下在多个领域展现出显著提升,优于传统基线方法。代码可在以下地址获取:\url{https://github.com/suntea233/DualLoRA}。

关键词

引用

@article{arxiv.2407.21633,
  title  = {Zero-Shot Cross-Domain Dialogue State Tracking via Dual Low-Rank Adaptation},
  author = {Xiang Luo and Zhiwen Tang and Jin Wang and Xuejie Zhang},
  journal= {arXiv preprint arXiv:2407.21633},
  year   = {2024}
}

备注

Accepted by ACL 2024