中文

SeeAction:从屏幕录制中逆向工程 HCI 操作的 How-What-Where 以实现 UI 自动化

软件工程 2025-03-18 v1

摘要

UI 自动化是 UI 测试、错误复现和机器人流程自动化的有用技术。使用应用程序记录用户操作可促进 UI 自动化脚本的快速开发,但现有记录技术具有侵入性、依赖操作系统或 GUI 框架可访问性支持,或假设特定的应用实现。从屏幕录制中逆向工程用户操作是一种非侵入性方法,但当前缺失的一个关键逆向工程步骤是从操作屏幕录制中识别人类可理解的结构化用户操作([command] [widget] [location])。为填补这一空白,我们提出一种基于深度学习的计算机视觉模型,可识别 11 条命令和 11 个小部件,并通过联合学习和多任务学习从操作屏幕录制中生成位置短语。我们标注了一个包含 7260 个视频-操作对的大型数据集,记录用户与 Word、Zoom、Firefox、Photoshop 和 Windows 10 设置的交互。通过大量实验,我们确认了该模型的有效性和通用性,并演示了基于该模型构建的屏幕录制到操作脚本工具对于错误复现的有用性。

关键词

引用

@article{arxiv.2503.12873,
  title  = {SeeAction: Towards Reverse Engineering How-What-Where of HCI Actions from Screencasts for UI Automation},
  author = {Dehai Zhao and Zhenchang Xing and Qinghua Lu and Xiwei Xu and Liming Zhu},
  journal= {arXiv preprint arXiv:2503.12873},
  year   = {2025}
}

备注

Accepted by IEEE/ACM International Conference on Software Engineering 2025 (ICSE 2025, Distinguished paper award)