中文

Typhoon 2:一系列面向泰语的开放文本与多模态大型语言模型

计算与语言 2024-12-20 v2 人工智能

摘要

本文介绍了 Typhoon 2,一系列针对泰语优化的文本和多模态大型语言模型。该系列包括用于文本、视觉和音频的模型。Typhoon2-Text 建立在最先进的开放模型(如 Llama 3 和 Qwen2)之上,我们在英语和泰语数据的混合集上进行了持续预训练。我们采用训练后技术来增强泰语性能,同时保留基础模型的原始能力。我们发布了多种规模的文本模型,参数量从 1 亿到 700 亿不等,提供基础版本和指令微调版本。为了对文本生成进行护栏防护,我们发布了 Typhoon2-Safety,一个针对泰语文化和语言增强的分类器。Typhoon2-Vision 改进了泰语文档理解,同时保留了通用的视觉能力,如图像描述。Typhoon2-Audio 引入了一种端到端的语音到语音模型架构,能够处理音频、语音和文本输入,并生成文本和语音输出。

关键词

引用

@article{arxiv.2412.13702,
  title  = {Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models},
  author = {Kunat Pipatanakul and Potsawee Manakul and Natapong Nitarach and Warit Sirichotedumrong and Surapon Nonesung and Teetouch Jaknamon and Parinthapat Pengpun and Pittawat Taveekitworachai and Adisai Na-Thalang and Sittipong Sripaisarnmongkol and Krisanapong Jirayoot and Kasima Tharnpipitchai},
  journal= {arXiv preprint arXiv:2412.13702},
  year   = {2024}
}

备注

technical report, 55 pages