超越独白:基于对话音频上下文感知核的交互式说话-倾听虚拟形象生成
人工智能
2026-04-14 v1 声音
摘要
音频驱动的人类视频生成在独白场景中取得了显著成功,主要归功于强大视频生成基础模型的进步。超越独白,真实的人类交流本质上是全双工交互过程,需要虚拟代理不仅要表达自己的 speech,还要自然地反应于 incoming 对话音频。大多数现有方法仅将传统音频驱动范式简单地扩展到倾听场景。然而,依赖严格的帧对帧对齐会导致模型对长期对话动态的响应僵硬,而直接引入全局注意力则会严重损害lip同步。鉴于说话和倾听行为之间的 unique 时序尺度差异,我们引入多头高斯核,显式地将这种物理直觉注入模型作为渐进式时序诱导偏置。构建于此之上,我们构建了一个能够同时处理 talking 和 listening 双流音频输入的全双工交互式虚拟代理。此外,我们引入了一个严格清洗的说话-倾听数据集VoxHear,包含完美解耦的 speech 和 background audio tracks。广泛的实验表明,我们的方法成功地将强时序对齐与深层语义语义融合,为生成高度自然和响应的全双工交互式数字人类设立了新的 state-of-the-art。项目页面可在 https://warmcongee.github.io/beyond-monologue/ 查看。
引用
@article{arxiv.2604.10367,
title = {Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels},
author = {Yuzhe Weng and Haotian Wang and Xinyi Yu and Xiaoyan Wu and Haoran Xu and Shan He and Jun Du},
journal= {arXiv preprint arXiv:2604.10367},
year = {2026}
}