中文

Adapter-Bot:一体化可控对话模型

计算与语言 2020-10-22 v2 人工智能

摘要

通过在大型对话数据集上训练大语言模型(LLM),在生成连贯流畅响应的对话模型方面已取得显著进展。这些模型对生成响应几乎或完全无法控制,且缺乏两个重要特性:持续的对话技能集成与无缝利用多样知识源。本文提出 Adapter-Bot,一种使用固定骨干对话模型(如 DialGPT(Zhang et al., 2019))并通过不同适配器(Houlsby et al., 2019)按需触发对话技能(如共情响应、天气信息、电影推荐)的对话模型。每个适配器可独立训练,从而允许在不重新训练整个模型的情况下持续集成技能。根据技能不同,该模型能够以无缝方式处理多种知识类型,如文本、表格和图。对话技能可通过对话管理器自动触发,也可手动触发,从而实现对生成响应的高层控制。当前阶段,我们已实现 12 种响应风格(如积极、消极等)、8 种面向目标的技能(如天气信息、电影推荐等),以及个性化与共情响应。我们使用自动评估将本模型与现有最先进对话模型比较,并已发布交互系统于 adapter.bot.ust.hk。

关键词

引用

@article{arxiv.2008.12579,
  title  = {The Adapter-Bot: All-In-One Controllable Conversational Model},
  author = {Andrea Madotto and Zhaojiang Lin and Yejin Bang and Pascale Fung},
  journal= {arXiv preprint arXiv:2008.12579},
  year   = {2020}
}

备注

Andrea Madotto and Zhaojiang Lin contributed equally to this work. Video demo: https://www.youtube.com/watch?v=Jz8KWE_gKH0&feature=youtu.be