中文

CHAMPAGNE:从大规模网络视频中学习真实世界对话

计算与语言 2023-08-17 v2 人工智能

摘要

视觉信息在对话中居于核心:例如,身体姿态和物理行为有助于传达超越文字本身的意义。然而迄今为止,大多数神经对话模型仅限于文本。我们提出 CHAMPAGNE,一种能够考虑视觉上下文的对话生成模型。为训练 CHAMPAGNE,我们收集并发布了 YTD-18M,一个包含 1800 万基于视频的对话的大规模语料库。YTD-18M 构建自网络视频:我们数据收集流程的关键在于一个预训练语言模型,该模型将易出错的自动转录文本转换为更干净的对话格式,同时保留语义。人工评估显示,YTD-18M 比先前资源(MMDialog,100 万对话)更合理且更具体,同时保持视觉接地性。实验表明:1)CHAMPAGNE 从 YTD-18M 中学习进行对话;2)微调后,其在四个聚焦于真实世界对话的视觉-语言任务上取得最先进(SOTA)结果。我们发布数据、模型和代码。

关键词

引用

@article{arxiv.2303.09713,
  title  = {CHAMPAGNE: Learning Real-world Conversation from Large-Scale Web Videos},
  author = {Seungju Han and Jack Hessel and Nouha Dziri and Yejin Choi and Youngjae Yu},
  journal= {arXiv preprint arXiv:2303.09713},
  year   = {2023}
}

备注

ICCV 2023, Project page: https://seungjuhan.me/champagne