利用图像增广进行物体操控:面向以对象为中心学习中的可解释可控性
计算机视觉与模式识别
2024-03-05 v4
摘要
人工神经网络中的绑定问题正被积极探究,其目标是通过以符号般实体理解世界来实现人类水平的识别能力。尤其在计算机视觉领域,以对象为中心的学习(OCL)被广泛研究,以通过获取对象表征或槽位更好地理解复杂场景。尽管近期 OCL 研究在复杂图像或视频上取得进展,但对象表征的可解释性与交互性仍大体未被探索,在 OCL 领域仍具前景。本文引入一种新方法——带图像增广的槽注意力(SlotAug),利用图像增广策略以自监督方式探索对槽位学习可解释可控性的可能。我们还通过提出的两个子方法——辅助恒等操控与槽一致性损失——对可控槽位引入可持续性概念,实现槽位的迭代与可逆控制。大量实证研究与理论验证确认了方法的有效性,为对象表征的可解释与可持续控制提供了新能力。
引用
@article{arxiv.2310.08929,
title = {Leveraging Image Augmentation for Object Manipulation: Towards Interpretable Controllability in Object-Centric Learning},
author = {Jinwoo Kim and Janghyuk Choi and Jaehyun Kang and Changyeon Lee and Ho-Jin Choi and Seon Joo Kim},
journal= {arXiv preprint arXiv:2310.08929},
year = {2024}
}