通过具身对话与解释学习视觉锚定域本体
人工智能
2024-12-16 v1
摘要
本文提出一种学习框架,通过教师在代理人解释其(错误)预测时提供纠正性反馈来弥补代理人的知识缺口。我们在资源有限的视觉处理场景中进行测试,代理人必须学习识别不同类型的玩具卡车。代理人在学习过程中没有关于存在哪些卡车类型以及哪些部件构成这些部件的本体知识,也没有足够的模型来从视觉输入中识别这些部件。教师对代理人解释的反馈通过通用规则(例如“垃圾卡车有垃圾箱”)来解决其本体知识的缺失,而通过指代语句(例如“这不是一个垃圾箱”)来纠正不准确的部件识别。学习者不仅利用此反馈来改进其对可能的域本体假设空间和其上的概率分布的估计,还利用这些估计来更新其对场景的视觉解释。我们的实验表明,使用解释和纠正的教师-学习者配对在数据效率方面优于没有此类能力的配对。
引用
@article{arxiv.2412.09770,
title = {Learning Visually Grounded Domain Ontologies via Embodied Conversation and Explanation},
author = {Jonghyuk Park and Alex Lascarides and Subramanian Ramamoorthy},
journal= {arXiv preprint arXiv:2412.09770},
year = {2024}
}
备注
Accepted to, and to appear in the Thirty-Ninth AAAI Conference on Artificial Intelligence (AAAI-25)