隐藏宝藏在哪里?应用 Transformer 模型检测设计讨论
软件工程
2026-03-20 v1
摘要
设计决策是软件工程的核心,出现在 Q&A 论坛、邮件列表、拉取请求、问题跟踪器和提交消息中。跨越项目历史的设计讨论为明智的决策提供了宝贵信息,如重构和软件现代化。机器学习技术已用于检测自然语言讨论中的设计决策,但其效果受限于标注数据的稀缺和高昂的标注成本。先前的工作采用跨域策略使用传统分类器,在一个领域上训练,在另一个领域上测试。尽管这些方法成功了,但 Transformer 基于模型(如 BERT、RoBERTa、XLNet、LaMini-Flan-T5-77M 和 ChatGPT-4o-mini)在这一领域中仍基本未被探索。本工作旨在调查 Transformer 基于模型(即 BERT、RoBERTa、XLNet、LaMini-Flan-T5-77M 和 ChatGPT-4o-mini)用于检测与设计相关讨论的性能。为此,我们在先前的跨域研究中进行了概念性复制,同时扩展了现代 Transformer 架构并解决了之前工作中的方法学问题。模型在 Stack Overflow 上微调,在 GitHub 工件(即拉取请求、问题和提交)上进行评估。BERT 和 RoBERTa 在跨域设置下表现出强大的召回率,而 XLNet 实现更高的精度但较低的召回率。ChatGPT-4o-mini 获得最高的召回率和整体表现最佳,LaMini-Flan-T5-77M 提供了一个轻量级替代方案,具有更好的精度但表现不够平衡。我们还评估了类似词注入用于数据增强,但与先前发现相反,它没有产生有意义的改进。总体而言,这些结果凸显了使用现代语言模型检测设计讨论的机遇与权衡。
引用
@article{arxiv.2603.18393,
title = {Where are the Hidden Gems? Applying Transformer Models for Design Discussion Detection},
author = {Lawrence Arkoh and Daniel Feitosa and Wesley K. G. Assunção},
journal= {arXiv preprint arXiv:2603.18393},
year = {2026}
}