中文

数据规模对UI控制智能体的影响

人工智能 2024-11-14 v6 机器学习

摘要

能够控制计算机界面以完成人类任务的自主智能体正在兴起。利用LLM来驱动此类智能体一直备受关注,但除非在人类收集的任务演示上进行微调,否则性能仍然相对较低。在这项工作中,我们研究微调本身是否是构建真实世界计算机控制智能体的可行方法。特别是,我们研究了在领域内和领域外的高层和低层任务上测量的性能如何随着更多训练数据的收集而扩展。为此,我们收集并发布了一个新数据集AndroidControl,其中包含15,283个使用Android应用完成日常任务的演示。与现有数据集相比,每个AndroidControl任务实例都包含高层和低层的人类生成指令,使我们能够探索智能体可以处理的任务复杂性水平。此外,AndroidControl是迄今为止最多样化的计算机控制数据集,包含833个Android应用上的14,548个独特任务,从而使我们能够深入分析模型在训练数据领域内和领域外的性能。利用该数据集,我们发现,在领域内测试时,微调模型优于零样本和少样本基线,并且其扩展方式表明,仅通过收集更多数据就可能可靠地获得稳健的性能。在领域外,性能扩展显著变慢,这表明特别是对于高层任务,仅靠微调更多数据可能不足以实现稳健的领域外性能。

关键词

引用

@article{arxiv.2406.03679,
  title  = {On the Effects of Data Scale on UI Control Agents},
  author = {Wei Li and William Bishop and Alice Li and Chris Rawles and Folawiyo Campbell-Ajala and Divya Tyamagundlu and Oriana Riva},
  journal= {arXiv preprint arXiv:2406.03679},
  year   = {2024}
}

备注

NeurIPS 2024 (Datasets and Benchmarks)