论使用验证集评估具身智能体模型泛化能力的局限性
计算与语言
2022-05-20 v1 人工智能
计算机视觉与模式识别
机器人学
摘要
自然语言引导的具身任务完成是一个具有挑战性的问题,因为它需要理解自然语言指令、将其与以自我为中心的视觉观测对齐,并选择适当动作在环境中执行以产生期望的变化。我们尝试为一个用于该任务的 transformer 模型增加一些模块,这些模块能有效利用更宽的视野,并学习选择下一步是需要导航动作还是操作动作。我们观察到,所提出的模块在流行基准数据集 ALFRED 的未见过验证集上取得了提升的、事实上是当前最优(state-of-the-art)的性能。然而,我们使用未见过验证集选出的最佳模型在 ALFRED 的未见过测试划分上表现不佳,这表明未见过验证集上的性能本身可能不足以作为模型改进能否泛化到未见过测试集的指标。我们强调这一结果,因为我们相信它可能是机器学习任务中一种更广泛的现象,但主要在限制测试划分评估的基准中才明显,并凸显了修改基准设计以更好地考虑模型性能方差的必要性。
引用
@article{arxiv.2205.09249,
title = {On the Limits of Evaluating Embodied Agent Model Generalization Using Validation Sets},
author = {Hyounghun Kim and Aishwarya Padmakumar and Di Jin and Mohit Bansal and Dilek Hakkani-Tur},
journal= {arXiv preprint arXiv:2205.09249},
year = {2022}
}
备注
ACL 2022 Insights Workshop (6 pages)