GoCoMA: 用于大语言模型生成代码归属的双曲多模态表示融合
计算与语言
2026-04-27 v2 计算机与社会
摘要
在大量代码语料库上训练的大语言模型(LLM)现在越来越能够生成难以与人类编写的代码区分的代码。这引发了实际问题,包括安全漏洞和许可模糊性,同时也激发了一个取证问题:“谁(或哪个LLM)编写了这段代码?”我们提出了GoCoMA,这是一个多模态框架,它建模了(i)代码风格学(捕捉更高级的结构和风格特征)与(ii)二进制预执行工件(BPEA)的图像表示(捕捉由编译和工具链塑造的、面向执行的底层字节语义)之间的外在层级结构。GoCoMA将模态嵌入投影到双曲庞加莱球中,通过基于测地余弦相似度的跨模态注意力(GCSA)融合机制进行融合,并将融合后的表示反向投影到欧几里得空间以进行最终的LLM来源归属。在两个开源基准测试(CoDET-M4和LLMAuthorBench)上的实验表明,在相同的评估协议下,GoCoMA始终优于单模态和欧几里得多模态基线。
引用
@article{arxiv.2604.16377,
title = {GoCoMA: Hyperbolic Multimodal Representation Fusion for Large Language Model-Generated Code Attribution},
author = {Nitin Choudhury and Bikrant Bikram Pratap Maurya and Bhavinkumar Vinodbhai Kuwar and Arun Balaji Buduru},
journal= {arXiv preprint arXiv:2604.16377},
year = {2026}
}
备注
Accepted to the International Conference on Multimedia & Expo (ICME) 2026