中文

StRuCom:面向俄语的结构化代码注释数据集

计算与语言 2025-05-19 v1 人工智能 机器学习 软件工程

摘要

结构化代码注释(docstring 格式)对于代码理解和维护至关重要,但现有机器学习模型在俄语代码注释生成方面表现不佳。为弥合这一差距,我们提出 StRuCom —— 首个专为俄语代码文档设计的大规模数据集(包含 153K 个样本)。与基于机器翻译的英文数据集不同,后者会扭曲术语(如技术外来词与字面翻译的区别)和 docstring 结构。StRuCom 组合来自俄语 GitHub 代码仓库的人工编写注释与合成生成注释,确保通过自动化验证符合 Python、Java、JavaScript、C# 和 Go 等语言标准。在 StRuCom 上微调 Qwen2.5-Coder 模型(参数规模 0.5B-7B),实验显示相较于基线模型,chrf++ 和 BERTScore 指标均实现统计显著提升。

关键词

引用

@article{arxiv.2505.11026,
  title  = {StRuCom: A Novel Dataset of Structured Code Comments in Russian},
  author = {Maria Dziuba and Valentin Malykh},
  journal= {arXiv preprint arXiv:2505.11026},
  year   = {2025}
}