利用推理向量增强日语大语言模型
人工智能
2025-08-06 v1
摘要
后训练方法提升了主流大语言模型 (LLM) 的性能并增强了其推理能力,但由于所需资源量巨大,日语 LLM 要实现同样的目标具有挑战性。受针对特定任务提取训练前后权重变化的任务向量的启发,我们从推理 LLM 中获取推理向量,并将其应用于日语 LLM 以提升其性能。尽管可用于改进日语 LLM 的资源面临挑战,我们提出了一种简单有效的方法来获得显著提升,并希望以此启发其他语言的相关研究。
引用
@article{arxiv.2508.02913,
title = {Enhancing Japanese Large Language Models with Reasoning Vectors},
author = {Carolina Minami Oguchi and Leo Wei and Koyo Kobayashi and Hsin-Tai Wu and Dipak Ghosal},
journal= {arXiv preprint arXiv:2508.02913},
year = {2025}
}