使机器人能够绘图与讲述:迈向视觉接地多模态描述生成
机器人学
2021-02-01 v1 人工智能
摘要
具有社会能力的机器人应具备感知周围世界并以类人方式进行交流的能力。展现此种能力的代表性技能包括生成图像描述和视觉接地的指称表达。在自然语言生成(NLG)领域,这些生成任务主要在非交互式和仅语言设置中被研究。然而,在面对面交互中,人类常部署多种模态进行交流,形成自然语言、手势以及其他如草图等模态的无缝整合。为使机器人能够通过语音和草图/手势描述其所感知的内容,我们提出对生成自然语言与自由手绘草图/手势以描述视觉场景和真实物体的任务进行建模,即视觉接地多模态描述生成。在本文中,我们讨论了该任务的挑战与评估指标,以及该任务如何受益于自然语言处理和计算机视觉领域近期的进展,其中视觉接地NLG、分布语义学和基于照片的草图生成等相关主题已被广泛研究。
引用
@article{arxiv.2101.12338,
title = {Enabling Robots to Draw and Tell: Towards Visually Grounded Multimodal Description Generation},
author = {Ting Han and Sina Zarrieß},
journal= {arXiv preprint arXiv:2101.12338},
year = {2021}
}
备注
The 2nd Workshop on NLG for HRI colocated with The 13th International Conference on Natural Language Generation