中文

FC-MIR:基于帧压缩多模态轨迹推理的移动屏幕意图感知推荐框架

人工智能 2025-12-23 v1

摘要

从移动 UI 操作轨迹识别用户意图是推进 UI 理解并实现任务自动化代理的关键问题。虽然多模态大语言模型(MLLM)在视频理解任务中表现出色,但其在移动端部署受限于高计算成本和低效的冗余帧处理。为此,我们提出了 FC-MIR 框架:通过关键帧采样和自适应拼接,压缩视觉冗余以提升推理效率,同时集成最新闭源 MLLM 或微调模型(如 Qwen3-VL)进行轨迹摘要与意图预测。我们进一步扩展任务范围,探索生成后预测操作和搜索建议,并引入细粒度指标评估摘要、预测和建议的实际效用。为进行严格评估,我们构建了覆盖 UI-Agent(Agent-I)和真实用户交互(Person-I)场景的 UI 轨迹数据集。实验结果表明,我们的压缩方法在 50%~60% 压缩率下仍保持性能;无论是闭源模型还是微调模型,都在意图摘要方面表现出色,支持轻量级设备端部署。然而,MLLM 在生成实用且“惊人”的建议方面仍存在挑战,仍有提升空间。最后,我们在真实场景中部署该框架,集成 UI 感知与 UI-Agent 代理,为该领域的后续进展奠定基础。

关键词

引用

@article{arxiv.2512.19107,
  title  = {FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning},
  author = {Zhe Yang and Xiaoshuang Sheng and Zhengnan Zhang and Jidong Wu and Zexing Wang and Xin He and Shenghua Xu and Guanjing Xiong},
  journal= {arXiv preprint arXiv:2512.19107},
  year   = {2025}
}