中文

利用推理向量增强日语大语言模型

人工智能 2025-08-06 v1

摘要

后训练方法提升了主流大语言模型 (LLM) 的性能并增强了其推理能力,但由于所需资源量巨大,日语 LLM 要实现同样的目标具有挑战性。受针对特定任务提取训练前后权重变化的任务向量的启发,我们从推理 LLM 中获取推理向量,并将其应用于日语 LLM 以提升其性能。尽管可用于改进日语 LLM 的资源面临挑战,我们提出了一种简单有效的方法来获得显著提升,并希望以此启发其他语言的相关研究。

关键词

引用

@article{arxiv.2508.02913,
  title  = {Enhancing Japanese Large Language Models with Reasoning Vectors},
  author = {Carolina Minami Oguchi and Leo Wei and Koyo Kobayashi and Hsin-Tai Wu and Dipak Ghosal},
  journal= {arXiv preprint arXiv:2508.02913},
  year   = {2025}
}