面向人工辅助歧义消解的可视化定位的仿真到实域迁移
计算机视觉与模式识别
2022-07-12 v2 人工智能
摘要
服务机器人应能与非专家人类用户自然交互,不仅在各种任务中帮助他们,还能接收指导以解决指令中可能存在的歧义。我们考虑可视化定位任务,其中智能体根据给定的自然语言描述从拥挤场景中分割出物体。现代整体式可视化定位方法通常忽略语言结构并难以覆盖通用领域,因此严重依赖大型数据集。此外,由于基准域与目标域之间的高度视觉差异,它们在 RGB-D 数据集中的迁移性能受到影响。模块化方法将学习与领域建模相结合,并利用语言的组合性质将视觉表示与语言解析解耦,但由于缺乏强监督,要么依赖外部解析器,要么以端到端方式训练。在这项工作中,我们试图通过引入一个完全解耦的模块化框架来解决这些局限,用于实体、属性和空间关系的组合式可视化定位。我们利用在合成域中生成的丰富场景图标注并独立训练每个模块。我们的方法在仿真和两个真实 RGB-D 场景数据集中均进行了评估。实验结果表明,我们框架的解耦特性允许轻松集成用于仿真到实域(Sim-To-Real)视觉识别的领域自适应方法,为机器人应用中的可视化定位提供了一种数据高效、鲁棒且可解释的解决方案。
引用
@article{arxiv.2205.12089,
title = {Sim-To-Real Transfer of Visual Grounding for Human-Aided Ambiguity Resolution},
author = {Georgios Tziafas and Hamidreza Kasaei},
journal= {arXiv preprint arXiv:2205.12089},
year = {2022}
}
备注
Accepted CoLLAs 2022