中文

GreenMind:面向结构化与逻辑推理的越南大语言模型

计算与语言 2025-08-12 v2

摘要

链式思维 (Chain-of-Thought, CoT) 是一种解决需要在生成最终答案之前进行中间推理步骤的 LLM 任务的稳健方法。本文介绍了 GreenMind-Medium-14B-R1,这是一个受 Group Relative Policy Optimization 微调策略启发的越南推理模型。我们还利用高质量的越南合成推理数据集,并设计两个奖励函数以解决该技术的主要局限性:(i) 我们显式检测在采样标记过程中是否存在偏置语言字符的存在;(ii) 我们利用基于句子转换器的模型确保生成的推理内容在事实上是正确的,不会扭曲最终输出。在越南 VLSP 2023 挑战赛数据集上的实验结果表明,我们的模型在各项指标上均优于先前工作,并增强了其响应的语言一致性。此外,我们将评估扩展到 SeaExam-a 多语言选择题数据集,显示了我们推理方法相对于 few-shot 提示技术的有效性。

关键词

引用

@article{arxiv.2504.16832,
  title  = {GreenMind: A Next-Generation Vietnamese Large Language Model for Structured and Logical Reasoning},
  author = {Luu Quy Tung and Hoang Quoc Viet and Pham Bao Loc and Vo Trong Thu},
  journal= {arXiv preprint arXiv:2504.16832},
  year   = {2025}
}