探索视觉-语言导航模型的潜在性能:一种快照集成方法
计算机视觉与模式识别
2021-11-30 v1 人工智能
机器学习
多媒体
摘要
视觉-语言导航(VLN)是人工智能领域一项极具挑战性的任务。尽管过去几年中得益于深度视觉与语言模型的突破,该任务取得了大量进展,构建能像人类一样泛化的 VLN 模型仍十分困难。本文提供一种改进 VLN 模型的新视角。基于我们发现同一 VLN 模型的快照即便成功率相近也表现显著不同,我们提出一种基于快照的集成方案,利用多个快照间的预测。基于现有最优(SOTA)模型 BERT 的快照及我们过往动作感知的修改,我们所提集成在 R2R 数据集挑战中以导航误差(NE)与按路径长度加权的成功率(SPL)取得了新的 SOTA 性能。
引用
@article{arxiv.2111.14267,
title = {Explore the Potential Performance of Vision-and-Language Navigation Model: a Snapshot Ensemble Method},
author = {Wenda Qin and Teruhisa Misu and Derry Wijaya},
journal= {arXiv preprint arXiv:2111.14267},
year = {2021}
}
备注
7 pages