中文

BERT 是否学会使用浏览器用户界面?用统一视觉-语言 BERT 探索多步任务

计算与语言 2022-03-16 v1

摘要

预训练 Transformer 因其任务无关表示而成为统一多任务模型的良好基础。预训练 Transformer 常与文本到文本框架结合,以单一模型执行多个任务。通过图形用户界面(GUI)执行任务是容纳各类任务(包括含视觉与语言输入的多步任务)的另一可行途径。然而,少有论文将预训练 Transformer 与通过 GUI 执行相结合。为填补此空白,我们探索一种框架:模型通过多步操作由网页实现的 GUI 来执行任务。我们开发了带与不带页面跳转的任务页面,并为该框架提出一种 BERT 扩展。我们用这些任务页面联合训练 BERT 扩展,并得到如下观察:(1) 模型学会了使用带与不带页面跳转的任务页面;(2) 在五个不带页面跳转的任务中,有四个模型性能达到不使用浏览器的原始 BERT 的 75% 以上;(3) 模型在未见任务上未有效泛化。这些结果表明,我们可将 BERT 微调至通过 GUI 进行的多步任务,且其在泛化性上仍有改进空间。代码将在线提供。

关键词

引用

@article{arxiv.2203.07828,
  title  = {Do BERTs Learn to Use Browser User Interface? Exploring Multi-Step Tasks with Unified Vision-and-Language BERTs},
  author = {Taichi Iki and Akiko Aizawa},
  journal= {arXiv preprint arXiv:2203.07828},
  year   = {2022}
}

备注

Work in Progress