探究推理对习语识别的影响
密码学与安全
2025-08-20 v1 机器学习
摘要
近期趋势正逐渐利用推理模型,以提高大型语言模型(LLM)在涉及逻辑步骤的众多任务上的性能。一个可能从事此框架的语言任务是习语识别,因为必须首先理解潜在的习语表达才能消除其歧义,也为推理奠定基础。本文我们探讨了推理能力如何影响大型语言模型中的习语识别性能,并检验模型规模的影响。我们对比评估了来自 DeepSeek-R1 蒸馏模型系列(参数规模从 1.5B 到 70B)在四个习语识别数据集上的表现。我们发现,推理的影响小于人们预期的,也更为多样化。对于较小的模型,生成链式思维(CoT)推理会提高基于数学调优的中间模型的性能,但不及基本模型的水平;而对于较大的模型(14B、32B 和 70B),则表现出适度的改进。我们的深入分析表明,较大的模型表现出良好的习语理解能力,成功地生成准确的表达定义,而较小的模型常常无法输出实际含义。因此,我们还实验性地在较小模型的提示中提供定义,我们展示在某些情况下可以提升性能。
引用
@article{arxiv.2508.13364,
title = {A Risk Manager for Intrusion Tolerant Systems: Enhancing HAL 9000 with New Scoring and Data Sources},
author = {Tadeu Freitas and Carlos Novo and Inês Dutra and João Soares and Manuel Correia and Benham Shariati and Rolando Martins},
journal= {arXiv preprint arXiv:2508.13364},
year = {2025}
}