迈向可扩展的网络无障碍审计:以多模态大语言模型作为副驾驶
人工智能
2025-11-06 v1 人机交互
摘要
确保网络无障碍对于推进数字空间中的社会福利、正义和平等至关重要,然而绝大多数网站用户界面仍然不合规,部分原因是当前审计实践的资源密集性和不可扩展性。虽然WCAG-EM为站点级一致性评估提供了一种结构化方法,但它需要大量人力,并且缺乏大规模执行的实际支持。在这项工作中,我们提出了一个审计框架AAA,它通过人机协作模型将WCAG-EM付诸实践。AAA以两项关键创新为基础:GRASP,一种基于图的多模态采样方法,通过学习视觉、文本和关系线索的嵌入来确保代表性页面覆盖;以及MaC,一个基于多模态大语言模型的副驾驶,通过跨模态推理和高强度任务中的智能辅助为审计员提供支持。这些组件共同实现了可扩展的端到端网络无障碍审计,通过AI增强的辅助赋能人类审计员,以产生实际影响。我们进一步贡献了四个新颖的数据集,用于审计流程核心阶段的基准测试。大量实验证明了我们方法的有效性,并提供了见解:经过微调的小规模语言模型可以充当有能力的专家。
引用
@article{arxiv.2511.03471,
title = {Towards Scalable Web Accessibility Audit with MLLMs as Copilots},
author = {Ming Gu and Ziwei Wang and Sicen Lai and Zirui Gao and Sheng Zhou and Jiajun Bu},
journal= {arXiv preprint arXiv:2511.03471},
year = {2025}
}
备注
15 pages. Accepted by AAAI 2026 AISI