中文

人类还是LLM?Web可访问性代码生成能力比较研究

软件工程 2025-03-21 v1

摘要

Web可访问性对于包容性数字体验至关重要,但LLM生成代码的可访问性尚未得到充分探索。本文提出了一项实证研究,比较了GPT-4o和Qwen2.5-Coder-32B-Instruct-AWQ生成的Web代码可访问性与人类编写代码的可访问性。结果表明,LLM在处理诸如颜色对比度和替代文本等基本功能时往往生成更可访问的代码,但在处理诸如ARIA属性等复杂问题时则表现不足。我们还评估了先进的提示策略(零样本、少样本、自我批判),发现它们虽能带来一些改进,但仍有局限。为弥补这些差距,我们引入了FeedA11y,这是一种基于反馈驱动的ReAct方法,显著优于其他方法。我们的工作凸显了LLM在可访问代码生成方面的潜力,并强调了反馈技术在解决持久挑战方面的重要性。

关键词

引用

@article{arxiv.2503.15885,
  title  = {Human or LLM? A Comparative Study on Accessible Code Generation Capability},
  author = {Hyunjae Suh and Mahan Tafreshipour and Sam Malek and Iftekhar Ahmed},
  journal= {arXiv preprint arXiv:2503.15885},
  year   = {2025}
}