中文

Valley3:面向电商的规模化全能型基础模型

人工智能 2026-05-07 v2

摘要

本文提出Valley3,这是一个用于多元化全球电商任务的全能型多模态大语言模型(MLLM),具备跨文本、图像、视频和音频的统一理解与推理能力。Valley3的一个关键特性是其原生多语言音频能力,旨在支持电商场景,尤其是短视频场景下的关键音视频任务。为实现这一目标,我们仔细设计了四阶段的全能型电商持续预训练管道,使Valley3逐步获得音频理解、跨模态指令跟随、电商领域知识以及长上下文推理能力,最终演变为适用于多种电商场景的全能模型。随后,我们通过后训练进一步改进Valley3,以鼓励长链推理并提供可控的推理模式,从而实现简单场景下的推理效率与复杂应用深度推理之间的平衡。此外,我们为Valley3配备了智能体搜索能力,主动调用搜索工具以获取电商深度研究任务所需的任务相关信息。为全面评估Valley3的能力,我们构建了一个覆盖6个任务的全能型电商基准测试。实验结果表明,Valley3在我们内部及开源电商基准测试中 consistently 优于强大 baselines,同时在通用领域基准测试中保持竞争力。

关键词

引用

@article{arxiv.2605.01278,
  title  = {Valley3: Scaling Omni Foundation Models for E-commerce},
  author = {Zeyu Chen and Guanghao Zhou and Qixiang Yin and Ziwang Zhao and Huanjin Yao and Pengjiu Xia and Min Yang and Cen Chen and Minghui Qiu},
  journal= {arXiv preprint arXiv:2605.01278},
  year   = {2026}
}