中文

轻量级视觉-语言融合框架用于从用户界面和元数据预测应用评分

计算机视觉与模式识别 2026-02-25 v1

摘要

应用评分是衡量移动应用质量、可用性和整体用户满意度的最重要指标之一。然而,现有的应用评分预测模型主要局限于文本数据或用户界面(UI)特征,忽视了同时利用UI和语义信息的重要性。为此,本研究提出了轻量级视觉-语言框架,将移动UI和语义信息集成用于应用评分预测。该框架组合使用MobileNetV3提取UI布局的视觉特征,采用DistilBERT提取文本特征。这些多模态特征通过带有Swish激活函数的门控融合模块进行融合,随后通过多层感知器(MLP)回归头进行处理。对该模型进行了评估,使用均方绝对误差(MAE)、均方根误差(RMSE)、均方误差(MSE)、决定系数(R2)和皮尔逊相关系数。经过20个epoch的训练后,模型实现了MAE为0.1060,RMSE为0.1433,MSE为0.0205,R2为0.8529,皮尔逊相关系数为0.9251。广泛的消融研究进一步证明了不同视觉和文本编码器组合的有效性。总体而言,提出的轻量级框架为开发人员和最终用户提供了有价值的见解,支持可持续的应用开发,并可在边缘设备上高效部署。

关键词

引用

@article{arxiv.2602.20531,
  title  = {A Lightweight Vision-Language Fusion Framework for Predicting App Ratings from User Interfaces and Metadata},
  author = {Azrin Sultana and Firoz Ahmed},
  journal= {arXiv preprint arXiv:2602.20531},
  year   = {2026}
}

备注

24 pages, 10 figures