Sharingan:从桌面录制中提取用户动作序列
计算机视觉与模式识别
2024-11-14 v1 人工智能
摘要
用户活动的视频录制,特别是桌面录制,为理解用户行为和自动化流程提供了丰富的数据源。然而,尽管视觉-语言模型(VLM)取得进展且在视频分析中的应用日益增加,从桌面录制中提取用户动作仍是一个探索不足的领域。本文通过提出两种基于 VLM 的用户动作提取新方法来填补这一空白:直接基于帧的方法(DF),将采样帧直接输入 VLM;以及差分基于帧的方法(DiffF),结合计算机视觉技术检测到的显式帧差。我们使用基础自建数据集和改编自先前工作的高级基准评估这些方法。结果显示,DF 方法在识别用户动作上达到 70% 至 80% 的准确率,提取的动作序列可通过机器人流程自动化(RPA)重放。我们发现,虽然 VLM 显示出潜力,但引入显式 UI 变化会降低性能,使 DF 方法更可靠。这项工作代表了 VLM 在从桌面录制中提取用户动作序列上的首次应用,为未来研究贡献了新方法、基准和见解。
引用
@article{arxiv.2411.08768,
title = {Sharingan: Extract User Action Sequence from Desktop Recordings},
author = {Yanting Chen and Yi Ren and Xiaoting Qin and Jue Zhang and Kehong Yuan and Lu Han and Qingwei Lin and Dongmei Zhang and Saravan Rajmohan and Qi Zhang},
journal= {arXiv preprint arXiv:2411.08768},
year = {2024}
}