InterAct:用于日常场景中两个人之间动态、表达和交互活动的大规模数据集
计算机视觉与模式识别
2025-09-09 v1 人工智能
机器学习
多智能体系统
机器人学
摘要
我们解决的问题是准确捕捉日常场景中两个人之间的交互行为。目前的大多数研究要么只考虑一个人,要么仅关注两个人的对话手势,假设每个演员的身体方向和/或位置在每次交互中保持不变或几乎不变。相反,我们提出同时建模两个人的活动,目标是实现目标导向、动态且在语义上一致的交互,这类交互通常持续更长时间且覆盖更大的空间。为此,我们捕捉了一个新的多模态数据集,称为 InterAct,由 241 个运动序列组成,其中两个人在持续一分钟或更长时间的完整交互中执行真实且连贯的情景。对于每个序列,两个演员被赋予不同的角色和情感标签,合作完成一个任务或进行常见的交互活动。两个人的音频、身体动作和面部表情都被捕捉。InterAct 包含个体和平复合动作,以及之前几乎看到的有趣且相对长期的交互模式。我们还展示了一个简单而有效的扩散方法,从语音输入估计两个人的交互式面部表情和身体动作。该方法以分层方式回归身体动作,我们还提出了一种新型的微调机制来提高面部表情的唇部准确性。为促进进一步的研究,数据和代码已在 https://hku-cg.github.io/interact/ 上提供。
引用
@article{arxiv.2509.05747,
title = {InterAct: A Large-Scale Dataset of Dynamic, Expressive and Interactive Activities between Two People in Daily Scenarios},
author = {Leo Ho and Yinghao Huang and Dafei Qin and Mingyi Shi and Wangpok Tse and Wei Liu and Junichi Yamagishi and Taku Komura},
journal= {arXiv preprint arXiv:2509.05747},
year = {2025}
}
备注
The first two authors contributed equally to this work