从编程截图推断问题
软件工程
2025-04-29 v1
摘要
将生成式AI集成到开发者论坛如Stack Overflow上为增强问题解决提供了机会,允许用户发布代码或集成开发环境(IDE)的截图,而不是传统的基于文本的查询。本研究评估了各种大型语言模型(LLM), Specifically LLAMA、GEMINI和GPT-4o在解释此类视觉输入方面的效果。我们采用prompt engineering技术,包括情境学习、链式思维提示和few-shot学习,以评估每个模型的响应性和准确性。我们的发现表明,尽管GPT-4o显示出有前景的能力,对于51.75%的测试图像实现了超过60%的基线问题相似度,但在获得更复杂图像的一致且准确的解释方面仍面临挑战。这项研究推进了我们对在开发者社区中使用生成式AI进行图像中心问题解决可行性的理解,既揭示了潜在优势,也凸显了当前方法的局限性,同时展望了视觉基于调试助手工具成为现实的未来。
引用
@article{arxiv.2504.18912,
title = {Inferring Questions from Programming Screenshots},
author = {Faiz Ahmed and Xuchen Tan and Folajinmi Adewole and Suprakash Datta and Maleknaz Nayebi},
journal= {arXiv preprint arXiv:2504.18912},
year = {2025}
}