推断用于 UI 图标的替代文本:基于大语言模型的应用开发中的自动化方法
人机交互
2024-10-10 v2 软件工程
摘要
确保移动应用的可访问性仍然是一个重要挑战,尤其是对于依赖屏幕阅读器的视障用户而言。用户界面图标是导航和交互的关键元素,常常缺乏有意义的替代文本,导致其有效使用的障碍。传统的深度学习方法生成替代文本需要大量数据集,并且难以应对图标类型的多样性和不平衡。更近期的视觉语言模型(VLM)需要完整的 UI 屏幕,在应用开发的迭代阶段往往难以实现。为解决这些问题,本文提出一种新方法,利用大语言模型(LLM)在仅具备部分 UI 数据的情况下自动生成具有信息性的移动 UI 图标替代文本。通过融合图标上下文,包括类别、资源 ID、边界、OCR 检测文本以及来自父节点和兄弟节点的上下文信息,我们在约 1400 张图标的数据集上对通用 LLM 进行微调,得到 IconDesc。实验评估和用户研究表明,IconDesc 在生成相关替代文本方面显著优于现有方法。这一能力使 IconDesc 成为开发人员优化 UI 可访问性进行快速迭代的宝贵工具。
引用
@article{arxiv.2409.18060,
title = {Inferring Alt-text For UI Icons With Large Language Models During App Development},
author = {Sabrina Haque and Christoph Csallner},
journal= {arXiv preprint arXiv:2409.18060},
year = {2024}
}