图像描述生成用于自动化软件文档的实证研究
软件工程
2023-01-04 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
现有的软件文档自动化技术通常试图在代码与自然语言这两类主要信息源之间进行推理。然而,这一推理过程常因更抽象的自然语言与更结构化的编程语言之间的词汇鸿沟而变得复杂。图形用户界面(GUI)可作为跨越该鸿沟的潜在桥梁,因为 GUI 天然将底层程序功能的关键信息编码为丰富的、基于像素的数据表示。本文提供了首批关于 GUI 与软件功能性自然语言描述之间联系的全面实证研究之一。首先,我们收集、分析并开源了一个大规模功能性 GUI 描述数据集,包含来自流行 Android 应用的 10,204 张截图的 45,998 条描述。描述由人工标注者获取并经过若干质量控制机制。为洞察 GUI 的表征潜力,我们考察了四种神经图像描述生成模型在输入截图的条件下预测不同粒度自然语言描述的能力。我们使用常见机器翻译指标对这些模型进行定量评估,并通过大规模用户研究进行定性评估。最后,我们总结了经验教训,并探讨了多模态模型在增强未来自动化软件文档技术方面所展现的潜力。
引用
@article{arxiv.2301.01224,
title = {An Empirical Investigation into the Use of Image Captioning for Automated Software Documentation},
author = {Kevin Moran and Ali Yachnes and George Purnell and Junayed Mahmud and Michele Tufano and Carlos Bernal-Cárdenas and Denys Poshyvanyk and Zach H'Doubler},
journal= {arXiv preprint arXiv:2301.01224},
year = {2023}
}
备注
Published in the Proceedings of the 29th IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER'22), Honolulu, Hawaii, March 15-18, 2022, pp. 514-525