基于LLM的网页无障碍修复:检测、修复与成本的实证研究
软件工程
2026-05-28 v1
摘要
大规模确保网页无障碍性仍然具有挑战性,因为基于规则的工具覆盖范围有限,而手动修复成本高昂且容易出错。本文评估了基于大型语言模型的智能体,特别是Kimi K2.5,在自动化无障碍检测和修复方面与基于规则的方法的比较。在检测方面,LLM达到了与基于规则工具相当的性能,F1分数约为0.65,语义理解能力强,F1分数为0.83,但在语法和布局相关违规方面的可靠性较低。在修复方面,LLM生成的修复在超过99.7%的情况下语法有效,并在80.2%的实例中提高了无障碍合规性,将每个文件的违规数从3.98减少到1.7。然而,完全解决的案例不到26%,并且大约30%的补丁引入了结构性变化。我们还发现,迭代的基于智能体的优化使计算成本增加了52%,API使用量增加了1.64倍,但没有改善修复结果。这些发现表明,虽然LLM对于部分无障碍修复是有效的,但对于完全和可靠的修复来说是不够的。可扩展的无障碍解决方案需要结合LLM能力与基于规则的验证和约束感知校正机制的混合方法。
引用
@article{arxiv.2605.27716,
title = {LLM Based Web Accessibility Repair: An Empirical Study of Detection, Remediation, and Cost},
author = {Oluwatoyosi Oyelayo and Ghada Abushaqra and Parham Asadi and Durjoy Dey and Diego Elias Costa},
journal= {arXiv preprint arXiv:2605.27716},
year = {2026}
}
备注
12 pages, 6 figures, preprint