基于合成环境的人类式概念组合学习
计算机视觉与模式识别
2025-04-10 v1
摘要
语言的组合结构使人类能够分解复杂短语并映射到新颖的视觉概念中,展现出灵活的智能能力。虽然存在几种算法具有组合性,但它们未能阐明人类如何通过试错学习来组合概念类别并将视觉线索 grounds。为探索这一多模态学习挑战,我们设计了一个三维合成环境,让智能体通过强化学习学习导航至由自然语言指令指定的目标。这些指令包含名词、形容词,并且关键的是冠词、介词或两者。词汇组合的庞大数组增加了视觉 grounding 任务的组合复杂度,因为当指令指定为“some blue cubes below the red sphere”时,导航至“蓝色立方体位于红色球体之上”是不会获得奖励的。我们首先演示了强化学习智能体能够将冠词概念对齐到视觉目标,但在更复杂的介词概念上则感到困难。其次,我们表明课程学习——一种人类所采用的策略——可提高概念学习效率,将冠词环境中所需训练剂集减少 15%,并使智能体能够轻松学习介词概念。最后,我们证明了在冠词或介词概念上训练的智能体能够分解未见的测试指令,并快速适应其导航策略以应对未见的视觉对象组合。凭借合成环境,我们的发现表明,多模态强化学习智能体能够实现复杂概念类别的组合理解,并凸显了类人学习策略在提高人工系统学习效率方面的有效性。
引用
@article{arxiv.2504.06618,
title = {Human-like compositional learning of visually-grounded concepts using synthetic environments},
author = {Zijun Lin and M Ganesh Kumar and Cheston Tan},
journal= {arXiv preprint arXiv:2504.06618},
year = {2025}
}