分层语义感知的倾听者头部视频生成:一种高性能流水线
计算机视觉与模式识别
2023-07-20 v1 多媒体
摘要
在双人说话者—倾听者互动中,倾听者的头部反应与说话者的头部运动共同构成重要的非语言语义表达。倾听者头部生成任务旨在基于说话者的音频与倾听者的参考图像合成具响应性的倾听者头部视频。相较于说话头部生成,捕捉来自说话者音频与视觉信息的相关性线索更具挑战。遵循 ViCo 基线方案,我们通过增强音频编码器模块的分层语义提取能力并改进解码器部分、渲染器及后处理模块,提出了一种高性能解决方案。我们的方案在倾听头部生成赛道的官方排行榜上获得第一。本文为 ACM Multimedia 2023 会议 ViCo@2023 对话头部生成挑战赛的技术报告。
引用
@article{arxiv.2307.09821,
title = {Hierarchical Semantic Perceptual Listener Head Video Generation: A High-performance Pipeline},
author = {Zhigang Chang and Weitai Hu and Qing Yang and Shibao Zheng},
journal= {arXiv preprint arXiv:2307.09821},
year = {2023}
}
备注
ACM MM 2023