中文

基于低参数大语言模型的词义消歧推理框架探索-分析-消歧

计算与语言 2026-03-06 v1

摘要

词义消歧 (Word Sense Disambiguation, WSD) 仍是自然语言处理 (NLP) 中的关键挑战,尤其是在处理罕见或领域特定的词义时常被误解。虽然现代高参数大语言模型 (LLM) 如 GPT-4-Turbo 在 WSD 方面展现出最前沿的性能,但其计算和能源需求限制了可扩展性。本研究探讨了低参数大语言模型 (<40亿参数) 是否可以通过强调推理驱动的词义识别的微调策略实现可比的结果。使用增强了半自动、理由丰富标注的 FEWS 数据集,我们对八个小规模开源大语言模型 (如 Gemma 和 Qwen) 进行微调。我们的结果表明,基于链式思考 (Chain-of-Thought, CoT) 的推理结合邻居词分析,在零样本设置下达到与 GPT-4-Turbo 相当的性能。重要的是,Gemma-3-4B 和 Qwen-3-4B 模型在 FEWS 上始终优于所有中等参数基线和最前沿模型,并在未见词义上表现出稳健的泛化能力。此外,对未见数据集 "Fool Me If You Can" 的评估确认了强大的跨域适应性,无需任务特定微调。本工作表明,通过精心构建的以推理为中心的微调策略,低参数大语言模型能够实现准确的 WSD,同时大幅降低计算和能源需求。

关键词

引用

@article{arxiv.2603.05400,
  title  = {An Exploration-Analysis-Disambiguation Reasoning Framework for Word Sense Disambiguation with Low-Parameter LLMs},
  author = {Deshan Sumanathilaka and Nicholas Micallef and Julian Hough},
  journal= {arXiv preprint arXiv:2603.05400},
  year   = {2026}
}

备注

Accepted at LREC 2026, 15 pages, 11 Tables