中文

我的数据里有什么新东西?通过对比生成进行新颖性探索

机器学习 2024-10-22 v1 人工智能 计算与语言

摘要

微调被广泛用于使语言模型适应特定目标,通常利用真实世界的数据,如患者记录、客户服务交互或预训练中未涵盖语言的网络内容。这些数据集通常规模庞大、嘈杂且通常是机密的,使得直接检查它们具有挑战性。然而,理解它们对于指导模型部署以及为数据清理或抑制微调期间学到的任何有害行为的决策至关重要。在本研究中,我们引入了通过生成进行新颖性发现的任务,该任务旨在通过生成说明这些属性的示例来识别微调数据集的新颖属性。我们的方法,对比生成探索(CGE),假设不直接访问数据,而是依赖于预训练模型和微调后的同一模型。通过对比这两个模型的预测,CGE可以生成突出微调数据新颖特征的示例。然而,这种简单的方法可能会产生彼此过于相似的示例,无法捕捉数据集中存在的新颖现象的全部范围。我们通过引入CGE的迭代版本来解决这个问题,其中先前生成的示例用于更新预训练模型,然后将这个更新后的模型与完全微调后的模型进行对比以生成下一个示例,从而促进生成输出的多样性。我们的实验证明了CGE在检测新颖内容(如有毒语言)以及新的自然语言和编程语言方面的有效性。此外,我们表明,即使在使用差分隐私技术微调模型时,CGE仍然有效。

关键词

引用

@article{arxiv.2410.14765,
  title  = {What's New in My Data? Novelty Exploration via Contrastive Generation},
  author = {Masaru Isonuma and Ivan Titov},
  journal= {arXiv preprint arXiv:2410.14765},
  year   = {2024}
}