是的,这边!借助支持型教师的片段内反馈学习将指称表达 grounding 为动作
计算机视觉与模式识别
2023-05-23 v1 计算与语言
摘要
在持续交互中捕捉语言信号的能力,对于未来机器学习模型自然地与人协作和互动至关重要。在本文中,我们提出了一项初步研究,评估在协作设定中给出的片段内反馈。我们使用指称语言游戏作为任务导向型协作联合活动的可控示例。教师以众所周知的符号算法(“增量算法”)生成指称表达作为初始指令,然后监控跟随者的动作,并可能以片段内反馈进行干预(无需显式请求)。我们将此任务构建为带有稀疏奖励的强化学习问题,并为启发式教师学习一个跟随者策略。我们的结果表明,片段内反馈使跟随者能在场景复杂性的某些方面上泛化,并且优于仅提供初始语句。
引用
@article{arxiv.2305.12880,
title = {Yes, this Way! Learning to Ground Referring Expressions into Actions with Intra-episodic Feedback from Supportive Teachers},
author = {Philipp Sadler and Sherzod Hakimov and David Schlangen},
journal= {arXiv preprint arXiv:2305.12880},
year = {2023}
}
备注
5 pages, Accepted at Findings of ACL 2023