中文

Her: 面向 end-to-end 人形智能体的初步研究

计算机视觉与模式识别 2024-08-07 v1

摘要

交互式虚拟人形智能体是与物理世界进行交互的关键接口。一个相对完整的人形智能体首先需要拥有面部和身体,然后具备言语和非言语能力(如眼神接触、面部表情、唇部动作、手势和操作),最终能够进行实时双向通信,例如主动插话对话的能力。大多数先前系统仅考虑这些元素的子集,留下了从真实人形智能体方面的差距。本文我们提出了一个能够建模真实agent行为的实时、双向、交互式 end-to-end 网络,包括语音、谈话时的全身动作、回应、闲置和操作。该系统是一个整合了音频和视觉输入的多模态模型,基于预训练的大型语言模型 (LLM) 扩展而来。我们收集了约20万小时的音频数据、约13万小时的视频数据和约2万个对齐样本来构建该模型。最终模型展示出以往系统难以实现的能力,如通用物体操作。本工作对该领域的 end-to-end 方法进行了初步探索,旨在激发进一步的研究以实现规模化。

关键词

引用

@article{arxiv.2408.02879,
  title  = {Body of Her: A Preliminary Study on End-to-End Humanoid Agent},
  author = {Tenglong Ao},
  journal= {arXiv preprint arXiv:2408.02879},
  year   = {2024}
}

备注

Technical Report v1; Project Page: https://aubrey-ao.github.io/BodyOfHer