生成概率并不足够:AI代码补全中的不确定性高亮
人机交互
2024-11-12 v3 人工智能
摘要
大规模生成模型推动了AI驱动代码补全工具的发展,以协助程序员编写代码。然而,如同其他AI驱动工具,AI驱动的代码补全并非总是准确,若未被程序员正确检测与纠正,可能将缺陷甚至安全漏洞引入代码。已提出并实现的一种帮助程序员识别潜在错误的技术是高亮不确定token。然而,尚无实证研究探索该技术的有效性——亦未考察生成模型语境下不同且尚未达成共识的不确定性概念。我们探讨传达不确定性信息是否能使程序员在与AI驱动代码补全工具协作时更快更准地生成代码,若是,何种不确定性度量最契合程序员需求。通过对30名程序员的混合方法研究,我们比较三种条件:仅提供AI系统代码补全、高亮由底层生成模型生成可能性最低的token、高亮由程序员编辑预测可能性最高的token。我们发现,高亮编辑预测可能性最高的token带来更快的任务完成与更具针对性的编辑,且被受试者主观偏好。相反,按生成概率高亮token相较无高亮的基线无任何益处。我们进一步探索AI驱动代码补全工具中传达不确定性的设计空间,发现程序员偏好细粒度、信息丰富、可解释且不令人不堪重负的高亮。
引用
@article{arxiv.2302.07248,
title = {Generation Probabilities Are Not Enough: Uncertainty Highlighting in AI Code Completions},
author = {Helena Vasconcelos and Gagan Bansal and Adam Fourney and Q. Vera Liao and Jennifer Wortman Vaughan},
journal= {arXiv preprint arXiv:2302.07248},
year = {2024}
}
备注
ACM Transactions on Computer-Human Interaction (TOCHI) 2024