中文

基于动态时间规整的指令条件导航通用评估

机器人学 2019-12-02 v2 人工智能 计算与语言

摘要

在指令条件导航中,智能体解释自然语言及其周围环境以在环境中导航。用于研究该任务的数据集通常包含这些指令与参考轨迹的对。然而,迄今为止使用的大多数评估指标未能恰当地考虑后者,而是依赖于不充分的相似性比较。我们解决了先前所用指标的根本缺陷,并展示了动态时间规整(DTW)——一种已知的测量两时间序列间相似性的方法——如何可用于导航智能体的评估。为此,我们定义了归一化动态时间规整(nDTW)指标,其软性惩罚对参考路径的偏离,自然对组成各路径的节点顺序敏感,适用于连续与基于图的评估,且可高效计算。进一步,我们定义了 SDTW,其将 nDTW 约束为仅成功路径。我们收集了人类对模拟路径的相似性判断,发现 nDTW 比其他所有指标更好地与人类排序相关。我们还证明,将 nDTW 用作强化学习导航智能体的奖励信号可提升其在 Room-to-Room (R2R) 和 Room-for-Room (R4R) 数据集上的性能。R4R 结果尤其凸显了 SDTW 优于先前成功约束指标的优越性。

关键词

引用

@article{arxiv.1907.05446,
  title  = {General Evaluation for Instruction Conditioned Navigation using Dynamic Time Warping},
  author = {Gabriel Ilharco and Vihan Jain and Alexander Ku and Eugene Ie and Jason Baldridge},
  journal= {arXiv preprint arXiv:1907.05446},
  year   = {2019}
}