控制大型语言模型在体裁分类与生成文本检测中的域外差距
计算与语言
2024-12-31 v1 人工智能
摘要
本研究表明,现代大型语言模型(LLMs,如 GPT-4)在先前关于预训练语言模型(PLMs,如 BERT)的研究中观察到的域外(OOD)性能差距同样存在。我们在两个非主题分类任务上证明了这一点:1)体裁分类和 2)生成文本检测。我们的结果表明,当上下文学习(ICL)的演示示例来自一个领域(例如旅游)而系统在另一个领域(例如历史)上测试时,分类性能显著下降。为了解决这个问题,我们引入了一种方法,控制分类过程中使用哪些预测指标以及排除哪些指标。对于这里研究的两个任务,这确保了主题特征被省略,同时模型被引导关注风格而非基于内容的属性。这种方法在少样本设置下将 OOD 差距减少了多达 20 个百分点。作为基线的直接思维链(CoT)方法被证明是不够的,而我们的方法持续增强了领域迁移性能。
引用
@article{arxiv.2412.20595,
title = {Controlling Out-of-Domain Gaps in LLMs for Genre Classification and Generated Text Detection},
author = {Dmitri Roussinov and Serge Sharoff and Nadezhda Puchnina},
journal= {arXiv preprint arXiv:2412.20595},
year = {2024}
}
备注
The 31st International Conference on Computational Linguistics