ACT2G:基于注意力的对比学习文本到手势生成
人机交互
2023-09-29 v1
摘要
近期远程办公、在线会议与遥操作任务的增加使人们意识到,虚拟形象与通信机器人的手势比以往认为的更为重要。它是实现人与 AI 系统之间平滑自然交流的关键因素之一,并已得到深入研究。当前手势生成方法多基于深度神经网络,以文本、音频及其他信息作为输入,然而它们主要基于音频生成手势,即所谓节拍手势。尽管节拍手势在实际人类手势中占比超 70%,但基于内容的手势有时对使虚拟形象更真实、更具人类特征起着重要作用。本文提出一种基于注意力的对比学习文本到手势(ACT2G),通过从输入文本估计每个词的注意力权重,使生成手势表征文本内容。该方法中,由注意力权重计算的文本与手势特征经对比学习映射到同一潜空间,一旦给定文本输入,网络即输出可用于生成相关内容手势的特征向量。用户研究证实 ACT2G 生成的手势优于现有方法。此外,通过创作者改变注意力权重,证明了同一文本可生成丰富多样的手势。
引用
@article{arxiv.2309.16162,
title = {ACT2G: Attention-based Contrastive Learning for Text-to-Gesture Generation},
author = {Hitoshi Teshima and Naoki Wake and Diego Thomas and Yuta Nakashima and Hiroshi Kawasaki and Katsushi Ikeuchi},
journal= {arXiv preprint arXiv:2309.16162},
year = {2023}
}