中文

HyperCLOVA X 8B Omni

机器学习 2026-01-06 v1 人工智能 计算与语言 声音

摘要

在本报告中, 我们介绍了 HyperCLOVA X 8B Omni, 该模型是 HyperCLOVA X 系列中首个支持文本、音频和视觉作为输入和输出的任意到任意多模态模型。 通过将多模态理解和生成整合到单个模型而非独立的模态特定管道中, HyperCLOVA X 8B Omni 作为一种 8B 规模的 omni-pathfinding 点, 通向实用性的任意到任意 omni 助手。 在概念层面, 该模型通过对交错多模态序列上的共享下一个标记预测接口来统一模态, 同时视觉和音频编码器为细粒度理解和 grounding 注入连续嵌入。 经验评估表明, 在 diverse input-output combinations 跨文本、音频和视觉, 包括韩语和英语, HyperCLOVA X 8B Omni 在与规模相当的模型中表现出竞争性能。 我们预计, HyperCLOVA X 8B Omni 的开源权重发布将支持广泛的研究和部署场景。

关键词

引用

@article{arxiv.2601.01792,
  title  = {HyperCLOVA X 8B Omni},
  author = {NAVER Cloud HyperCLOVA X Team},
  journal= {arXiv preprint arXiv:2601.01792},
  year   = {2026}
}

备注

Technical Report