中文

FixMyPose:姿态纠正描述生成与目标姿态检索

计算与语言 2021-04-06 v1 人工智能 计算机视觉与模式识别

摘要

随着健康趋势的兴起,人们对理疗以及瑜伽/舞蹈等个人锻炼的兴趣日益增加。然而,若无专家指导,此类锻炼难以跟练(而专家指导无法规模化地为每位远程学员提供个性化反馈)。因此,对自动化姿态纠正系统的需求比以往任何时候都更迫切,为此我们引入了一个名为 FixMyPose 的新描述生成数据集以满足这一需求。我们收集了将“当前”姿态纠正至形似“目标”姿态的描述(含英语与印地语)。所收集描述具有有趣的语言特性,例如以自我为中心的环境物体关系、类比指代等,要求理解空间关系与关于姿势的常识知识。此外,为避免机器学习偏差,我们保持了具有不同人口统计学特征的角色之间的平衡,这些角色在多种室内环境(如家庭、办公室)中执行各类动作。基于我们的数据集,我们提出了姿态纠正描述生成任务及其反向的目标姿态检索任务。在纠正描述生成任务中,模型必须生成如何从当前姿态图像移动到目标姿态图像的描述;而在检索任务中,模型应根据初始姿态与纠正描述选出正确的目标姿态。我们给出了强大的交叉注意力基线模型(单模态/多模态、强化学习、多语言),并表明我们的基线在其他图像差异数据集上评估时与其他模型相比也具有竞争力。我们还提出了新的任务专用指标(物体匹配、身体部位匹配、方向匹配),并进行人工评估以实现更可靠的评价,且展示了较大的人-模型性能差距,表明存在值得期待的未来工作空间。为验证 FixMyPose 数据集的仿真到真实迁移能力,我们收集了一组真实图像,并在这些图像上展示了有前景的性能。

关键词

引用

@article{arxiv.2104.01703,
  title  = {FixMyPose: Pose Correctional Captioning and Retrieval},
  author = {Hyounghun Kim and Abhay Zala and Graham Burri and Mohit Bansal},
  journal= {arXiv preprint arXiv:2104.01703},
  year   = {2021}
}

备注

AAAI 2021 (18 pages, 16 figures; webpage: https://fixmypose-unc.github.io/)