机器学习模型溯源挑战赛
机器学习
2023-02-20 v3 计算与语言
密码学与安全
摘要
我们展示了机器学习模型溯源挑战赛(Machine Learning Model Attribution Challenge)的结果。微调后的机器学习模型可能源自其他已训练模型而无明显的溯源特征。在本挑战中,参与者仅利用模型的文本输出,识别一组匿名、微调的大语言模型(LLMs)所基于的公开可用基础模型。参赛者旨在正确溯源最多的微调模型,平局时倾向于使用更少次微调模型 API 调用的解法。最成功的方法为人工方式,参与者观察模型输出间的相似性并基于基础模型的公开文档开发溯源启发式规则,尽管若干团队也提交了自动化的统计解法。
引用
@article{arxiv.2302.06716,
title = {Machine Learning Model Attribution Challenge},
author = {Elizabeth Merkhofer and Deepesh Chaudhari and Hyrum S. Anderson and Keith Manville and Lily Wong and João Gante},
journal= {arXiv preprint arXiv:2302.06716},
year = {2023}
}