通过测试时扩展弥合越南语小语言模型的推理差距
计算与语言
2026-04-21 v1 人工智能
摘要
普适人工智能的普及取决于在资源受限设备上部署复杂的推理能力。然而,小语言模型(SLM)常常面临“推理差距”,尤其是在越南语等非英语语言中,它们难以维持连贯的思维链。本文研究了在越南小学数学背景下,针对Qwen3-1.7B架构的测试时扩展策略。我们引入了Vi-S1K,一个通过Gemini 2.5 Flash-Lite驱动的流水线本地化的高保真推理数据集,以及Vi-Elementary-Bench,一个用于严格评估的双资源基准。使用LLM-as-a-Judge协议,我们揭示了基础模型拥有强大的潜在知识(准确率:4.05/5.00),但在沟通方面存在严重的“格式差距”。监督微调(SFT)起到了关键的“推理解锁器”作用,使解释质量提高了77%,弥合了原始计算与教学连贯性之间的差距。此外,我们对提示策略的分析揭示了一个显著的权衡:像ReAct这样的结构化框架对1.7B参数容量施加了“认知税”,相对于纯思维链(CoT)结合自洽性,性能有所下降。这些发现为SLM建立了部署层级,证明SFT结合简化的测试时扩展优于复杂的智能体工作流,适用于边缘推理。
引用
@article{arxiv.2604.17794,
title = {Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling},
author = {Bui The Trung and Do Minh Duc and Nguyen Van Vinh and Bui Nguyen Quoc Trinh},
journal= {arXiv preprint arXiv:2604.17794},
year = {2026}
}
备注
FJICAI conference