English
Related papers

Related papers: Seedance 1.5 pro: A Native Audio-Visual Joint Gene…

200 papers

Notable breakthroughs in diffusion modeling have propelled rapid improvements in video generation, yet current foundational model still face critical challenges in simultaneously balancing prompt following, motion plausibility, and visual…

Seedance 2.0 is a new native multi-modal audio-video generation model, officially released in China in early February 2026. Compared with its predecessors, Seedance 1.0 and 1.5 Pro, Seedance 2.0 adopts a unified, highly efficient, and…

Computer Vision and Pattern Recognition · Computer Science 2026-04-16 Team Seedance , De Chen , Liyang Chen , Xin Chen , Ying Chen , Zhuo Chen , Zhuowei Chen , Feng Cheng , Tianheng Cheng , Yufeng Cheng , Mojie Chi , Xuyan Chi , Jian Cong , Qinpeng Cui , Fei Ding , Qide Dong , Yujiao Du , Haojie Duanmu , Junliang Fan , Jiarui Fang , Jing Fang , Zetao Fang , Chengjian Feng , Yu Gao , Diandian Gu , Dong Guo , Hanzhong Guo , Qiushan Guo , Boyang Hao , Hongxiang Hao , Haoxun He , Jiaao He , Qian He , Tuyen Hoang , Heng Hu , Ruoqing Hu , Yuxiang Hu , Jiancheng Huang , Weilin Huang , Zhaoyang Huang , Zhongyi Huang , Jishuo Jin , Ming Jing , Ashley Kim , Shanshan Lao , Yichong Leng , Bingchuan Li , Gen Li , Haifeng Li , Huixia Li , Jiashi Li , Ming Li , Xiaojie Li , Xingxing Li , Yameng Li , Yiying Li , Yu Li , Yueyan Li , Chao Liang , Han Liang , Jianzhong Liang , Ying Liang , Wang Liao , J. H. Lien , Shanchuan Lin , Xi Lin , Feng Ling , Yue Ling , Fangfang Liu , Jiawei Liu , Jihao Liu , Jingtuo Liu , Shu Liu , Sichao Liu , Wei Liu , Xue Liu , Zuxi Liu , Ruijie Lu , Lecheng Lyu , Jingting Ma , Tianxiang Ma , Xiaonan Nie , Jingzhe Ning , Junjie Pan , Xitong Pan , Ronggui Peng , Xueqiong Qu , Yuxi Ren , Yuchen Shen , Guang Shi , Lei Shi , Yinglong Song , Fan Sun , Li Sun , Renfei Sun , Wenjing Tang , Boyang Tao , Zirui Tao , Dongliang Wang , Feng Wang , Hulin Wang , Ke Wang , Qingyi Wang , Rui Wang , Shuai Wang , Shulei Wang , Weichen Wang , Xuanda Wang , Yanhui Wang , Yue Wang , Yuping Wang , Yuxuan Wang , Zijie Wang , Ziyu Wang , Guoqiang Wei , Meng Wei , Di Wu , Guohong Wu , Hanjie Wu , Huachao Wu , Jian Wu , Jie Wu , Ruolan Wu , Shaojin Wu , Xiaohu Wu , Xinglong Wu , Yonghui Wu , Ruiqi Xia , Xin Xia , Xuefeng Xiao , Shuang Xu , Bangbang Yang , Jiaqi Yang , Runkai Yang , Tao Yang , Yihang Yang , Zhixian Yang , Ziyan Yang , Fulong Ye , Bingqian Yi , Xing Yin , Yongbin You , Linxiao Yuan , Weihong Zeng , Xuejiao Zeng , Yan Zeng , Siyu Zhai , Zhonghua Zhai , Bowen Zhang , Chenlin Zhang , Heng Zhang , Jun Zhang , Manlin Zhang , Peiyuan Zhang , Shuo Zhang , Xiaohe Zhang , Xiaoying Zhang , Xinyan Zhang , Xinyi Zhang , Yichi Zhang , Zixiang Zhang , Haiyu Zhao , Huating Zhao , Liming Zhao , Yian Zhao , Guangcong Zheng , Jianbin Zheng , Xiaozheng Zheng , Zerong Zheng , Kuan Zhu , Feilong Zuo

We present Seed1.5-VL, a vision-language foundation model designed to advance general-purpose multimodal understanding and reasoning. Seed1.5-VL is composed with a 532M-parameter vision encoder and a Mixture-of-Experts (MoE) LLM of 20B…

Computer Vision and Pattern Recognition · Computer Science 2025-05-13 Dong Guo , Faming Wu , Feida Zhu , Fuxing Leng , Guang Shi , Haobin Chen , Haoqi Fan , Jian Wang , Jianyu Jiang , Jiawei Wang , Jingji Chen , Jingjia Huang , Kang Lei , Liping Yuan , Lishu Luo , Pengfei Liu , Qinghao Ye , Rui Qian , Shen Yan , Shixiong Zhao , Shuai Peng , Shuangye Li , Sihang Yuan , Sijin Wu , Tianheng Cheng , Weiwei Liu , Wenqian Wang , Xianhan Zeng , Xiao Liu , Xiaobo Qin , Xiaohan Ding , Xiaojun Xiao , Xiaoying Zhang , Xuanwei Zhang , Xuehan Xiong , Yanghua Peng , Yangrui Chen , Yanwei Li , Yanxu Hu , Yi Lin , Yiyuan Hu , Yiyuan Zhang , Youbin Wu , Yu Li , Yudong Liu , Yue Ling , Yujia Qin , Zanbo Wang , Zhiwu He , Aoxue Zhang , Bairen Yi , Bencheng Liao , Can Huang , Can Zhang , Chaorui Deng , Chaoyi Deng , Cheng Lin , Cheng Yuan , Chenggang Li , Chenhui Gou , Chenwei Lou , Chengzhi Wei , Chundian Liu , Chunyuan Li , Deyao Zhu , Donghong Zhong , Feng Li , Feng Zhang , Gang Wu , Guodong Li , Guohong Xiao , Haibin Lin , Haihua Yang , Haoming Wang , Heng Ji , Hongxiang Hao , Hui Shen , Huixia Li , Jiahao Li , Jialong Wu , Jianhua Zhu , Jianpeng Jiao , Jiashi Feng , Jiaze Chen , Jianhui Duan , Jihao Liu , Jin Zeng , Jingqun Tang , Jingyu Sun , Joya Chen , Jun Long , Junda Feng , Junfeng Zhan , Junjie Fang , Junting Lu , Kai Hua , Kai Liu , Kai Shen , Kaiyuan Zhang , Ke Shen , Ke Wang , Keyu Pan , Kun Zhang , Kunchang Li , Lanxin Li , Lei Li , Lei Shi , Li Han , Liang Xiang , Liangqiang Chen , Lin Chen , Lin Li , Lin Yan , Liying Chi , Longxiang Liu , Mengfei Du , Mingxuan Wang , Ningxin Pan , Peibin Chen , Pengfei Chen , Pengfei Wu , Qingqing Yuan , Qingyao Shuai , Qiuyan Tao , Renjie Zheng , Renrui Zhang , Ru Zhang , Rui Wang , Rui Yang , Rui Zhao , Shaoqiang Xu , Shihao Liang , Shipeng Yan , Shu Zhong , Shuaishuai Cao , Shuangzhi Wu , Shufan Liu , Shuhan Chang , Songhua Cai , Tenglong Ao , Tianhao Yang , Tingting Zhang , Wanjun Zhong , Wei Jia , Wei Weng , Weihao Yu , Wenhao Huang , Wenjia Zhu , Wenli Yang , Wenzhi Wang , Xiang Long , XiangRui Yin , Xiao Li , Xiaolei Zhu , Xiaoying Jia , Xijin Zhang , Xin Liu , Xinchen Zhang , Xinyu Yang , Xiongcai Luo , Xiuli Chen , Xuantong Zhong , Xuefeng Xiao , Xujing Li , Yan Wu , Yawei Wen , Yifan Du , Yihao Zhang , Yining Ye , Yonghui Wu , Yu Liu , Yu Yue , Yufeng Zhou , Yufeng Yuan , Yuhang Xu , Yuhong Yang , Yun Zhang , Yunhao Fang , Yuntao Li , Yurui Ren , Yuwen Xiong , Zehua Hong , Zehua Wang , Zewei Sun , Zeyu Wang , Zhao Cai , Zhaoyue Zha , Zhecheng An , Zhehui Zhao , Zhengzhuo Xu , Zhipeng Chen , Zhiyong Wu , Zhuofan Zheng , Zihao Wang , Zilong Huang , Ziyu Zhu , Zuquan Song

Joint audio-video generation models are rapidly approaching professional production quality, raising a central question: do they understand audio-visual physics, or merely generate plausible sounds and frames that violate real-world…

We present Seed3D 2.0, an advanced 3D content generation system built on Seed3D 1.0, with substantial improvements across generation fidelity, simulation-ready capabilities, and application coverage. For geometry, a coarse-to-fine two-stage…

This study aims to construct an audio-video generative model with minimal computational cost by leveraging pre-trained single-modal generative models for audio and video. To achieve this, we propose a novel method that guides single-modal…

Computer Vision and Pattern Recognition · Computer Science 2025-02-26 Akio Hayakawa , Masato Ishii , Takashi Shibuya , Yuki Mitsufuji

In this work, we propose Mutual Forcing, a framework for fast autoregressive audio-video generation with long-horizon audio-video synchronization. Our approach addresses two key challenges: joint audio-video modeling and fast autoregressive…

Computer Vision and Pattern Recognition · Computer Science 2026-04-29 Yupeng Zhou , Lianghua Huang , Zhifan Wu , Jiabao Wang , Yupeng Shi , Biao Jiang , Daquan Zhou , Yu Liu , Ming-Ming Cheng , Qibin Hou

The rapid advancement of Artificial Intelligence Generated Content (AIGC) has revolutionized video generation, enabling systems ranging from proprietary pioneers like OpenAI's Sora, Google's Veo3, and Bytedance's Seedance to powerful…

Computer Vision and Pattern Recognition · Computer Science 2026-04-09 Teng Hu , Jiangning Zhang , Hongrui Huang , Ran Yi , Zihan Su , Jieyu Weng , Zhucun Xue , Lizhuang Ma , Ming-Hsuan Yang , Dacheng Tao

In recent years, with the realistic generation results and a wide range of personalized applications, diffusion-based generative models gain huge attention in both visual and audio generation areas. Compared to the considerable advancements…

Computer Vision and Pattern Recognition · Computer Science 2024-05-27 Shiqi Yang , Zhi Zhong , Mengjie Zhao , Shusuke Takahashi , Masato Ishii , Takashi Shibuya , Yuki Mitsufuji

The rapid evolution of multimodal foundation model has demonstrated significant progresses in vision-language understanding and generation, e.g., our previous work SEED-LLaMA. However, there remains a gap between its capability and the…

Computer Vision and Pattern Recognition · Computer Science 2025-03-04 Yuying Ge , Sijie Zhao , Jinguo Zhu , Yixiao Ge , Kun Yi , Lin Song , Chen Li , Xiaohan Ding , Ying Shan

Due to the lack of effective cross-modal modeling, existing open-source audio-video generation methods often exhibit compromised lip synchronization and insufficient semantic consistency. To mitigate these drawbacks, we propose UniAVGen, a…

Computer Vision and Pattern Recognition · Computer Science 2026-03-25 Guozhen Zhang , Zixiang Zhou , Teng Hu , Ziqiao Peng , Youliang Zhang , Yi Chen , Yuan Zhou , Qinglin Lu , Limin Wang

Joint audio-video generation models have shown that unified generation yields stronger cross-modal coherence than cascaded approaches. However, existing models couple modalities throughout denoising via pervasive attention, treating…

Computer Vision and Pattern Recognition · Computer Science 2026-04-28 Zhen Ye , Xu Tan , Aoxiong Yin , Hongzhan Lin , Guangyan Zhang , Peiwen Sun , Yiming Li , Chi-Min Chan , Wei Ye , Shikun Zhang , Wei Xue

Diffusion-based generative speech enhancement (SE) has recently received attention, but reverse diffusion remains time-consuming. One solution is to initialize the reverse diffusion process with enhanced features estimated by a predictive…

Latent diffusion models (LDMs) dominate high-quality image generation, yet integrating representation learning with generative modeling remains a challenge. We introduce a novel generative image modeling framework that seamlessly bridges…

Computer Vision and Pattern Recognition · Computer Science 2026-01-23 Theodoros Kouzelis , Efstathios Karypidis , Ioannis Kakogeorgiou , Spyros Gidaris , Nikos Komodakis

Audio-driven talking-head generation has advanced rapidly with diffusion-based generative models, yet producing temporally coherent videos with fine-grained motion control remains challenging. We propose DEMO, a flow-matching generative…

Computer Vision and Pattern Recognition · Computer Science 2025-10-14 Peiyin Chen , Zhuowei Yang , Hui Feng , Sheng Jiang , Rui Yan

AIGC has rapidly expanded from text-to-image generation toward high-quality multimodal synthesis across video and audio. Within this context, joint audio-video generation (JAVG) has emerged as a fundamental task that produces synchronized…

Computer Vision and Pattern Recognition · Computer Science 2026-02-24 Kai Liu , Yanhao Zheng , Kai Wang , Shengqiong Wu , Rongjunchen Zhang , Jiebo Luo , Dimitrios Hatzinakos , Ziwei Liu , Hao Fei , Tat-Seng Chua

We present Genesis, a unified framework for joint generation of multi-view driving videos and LiDAR sequences with spatio-temporal and cross-modal consistency. Genesis employs a two-stage architecture that integrates a DiT-based video…

Computer Vision and Pattern Recognition · Computer Science 2025-06-23 Xiangyu Guo , Zhanqian Wu , Kaixin Xiong , Ziyang Xu , Lijun Zhou , Gangwei Xu , Shaoqing Xu , Haiyang Sun , Bing Wang , Guang Chen , Hangjun Ye , Wenyu Liu , Xinggang Wang

Multimodal generative models have shown remarkable progress in single-modality video and audio synthesis, yet truly joint audio-video generation remains an open challenge. In this paper, I explore four key contributions to advance this…

Sound · Computer Science 2026-03-18 Alejandro Paredes La Torre

Generating semantically and temporally aligned audio content in accordance with video input has become a focal point for researchers, particularly following the remarkable breakthrough in text-to-video generation. In this work, we aim to…

Sound · Computer Science 2025-03-12 Manjie Xu , Chenxing Li , Xinyi Tu , Yong Ren , Rilin Chen , Yu Gu , Wei Liang , Dong Yu

Unified audio-language modeling has emerged as a prominent trend in modern speech systems, promising to bring the reasoning capabilities of large language models to auditory tasks. However, existing unified foundations often struggle to…

‹ Prev 1 2 3 10 Next ›