English

SiamGPT: Quality-First Fine-Tuning for Stable Thai Text Generation

Computation and Language 2026-01-09 v3

Abstract

Open-weights large language models remain difficult to deploy for Thai due to unstable generation under complex instructions, despite strong English performance. To mitigate these limitations, We present SiamGPT-32B, an open-weights model based on Qwen3-32B, fine-tuned with a Quality-First strategy emphasizing curated supervision over data scale. The fine-tuning pipeline combines high-complexity English instruction data with a Thai-adapted AutoIF framework for instruction and linguistic constraints. Using supervised fine-tuning only, without continual pretraining or corpus expansion, SiamGPT-32B improves instruction adherence, multi-turn robustness, and linguistic stability. Evaluations on the SEA-HELM benchmark show that SiamGPT-32B achieves the strongest overall performance among similar-scale open-weights Thai models, with consistent gains in instruction following, multi-turn dialogue, and natural language understanding.

Cite

@article{arxiv.2512.19455,
  title  = {SiamGPT: Quality-First Fine-Tuning for Stable Thai Text Generation},
  author = {Thittipat Pairatsuppawat and Abhibhu Tachaapornchai and Paweekorn Kusolsomboon and Chutikan Chaiwong and Thodsaporn Chay-intr and Kobkrit Viriyayudhakorn and Nongnuch Ketui and Aslan B. Wong},
  journal= {arXiv preprint arXiv:2512.19455},
  year   = {2026}
}
R2 v1 2026-07-01T08:37:02.612Z