响应性倾听头部生成:一个基准数据集与基线
计算机视觉与模式识别
2022-07-21 v3
摘要
我们提出一个新的倾听头部生成基准,用于合成面对面交谈中倾听者(如点头、微笑)的响应性反馈。作为说话头部生成不可或缺的补充,倾听头部生成在文献中极少被研究。自动合成主动响应说话头部的倾听行为,对数字人、虚拟代理和社交机器人等应用至关重要。本工作中,我们提出新颖数据集“ViCo”,突出面对面交谈中的倾听头部生成。ViCo共涉及92个身份(67名说话者与76名倾听者),以配对的“说话-倾听”模式呈现483个片段,其中倾听者基于态度展现三种倾听风格:积极、中性、消极。不同于传统的语音到姿态或说话头部生成,倾听头部生成以说话者的音频与视觉信号为输入,并实时给出非言语反馈(如头部运动、面部表情)。我们的数据集支持广泛应用,如人-人交互、视频到视频翻译、跨模态理解与生成。为鼓励进一步研究,我们还发布了一个基于不同倾听态度的倾听头部生成基线。代码与ViCo数据集:https://project.mhzhou.com/vico。
引用
@article{arxiv.2112.13548,
title = {Responsive Listening Head Generation: A Benchmark Dataset and Baseline},
author = {Mohan Zhou and Yalong Bai and Wei Zhang and Ting Yao and Tiejun Zhao and Tao Mei},
journal= {arXiv preprint arXiv:2112.13548},
year = {2022}
}
备注
Accepted by ECCV 2022