grounding 自然语言指令:大语言模型能否捕捉空间信息?
计算与语言
2021-09-20 v1 人工智能
摘要
为智能流程自动化设计的模型需要具备 grounding 用户界面元素的能力。这一界面元素 grounding 任务的核心在于将自然语言指令与其目标指称对象相链接。尽管 BERT 及类似预训练语言模型在多项 NLP 任务中表现出色,但其在 UI grounding 领域的应用尚未被广泛探索。本文着重测试并探查三种基于 transformer 的模型(BERT、RoBERTa 和 LayoutLM)的 grounding 能力。鉴于空间推理技能在该领域的重要性,我们的主要焦点在于这些模型的空间推理能力。我们观察到,尽管 LayoutLM 最初是为不同目的(表示扫描文档)而创建的,但其在这一领域的应用中具有可观优势:所学到的空间特征似乎可迁移至 UI grounding 场景,尤其体现在它们能区分自然语言指令中的目标方向。
引用
@article{arxiv.2109.08634,
title = {Grounding Natural Language Instructions: Can Large Language Models Capture Spatial Information?},
author = {Julia Rozanova and Deborah Ferreira and Krishna Dubba and Weiwei Cheng and Dell Zhang and Andre Freitas},
journal= {arXiv preprint arXiv:2109.08634},
year = {2021}
}
备注
*Equal contribution