English
Related papers

Related papers: HunyuanOCR Technical Report

200 papers

Visual-Language Models (VLMs), with their strong capabilities in image and text understanding, offer a solid foundation for intelligent communications. However, their effectiveness is constrained by limited token granularity, overlong…

Computer Vision and Pattern Recognition · Computer Science 2026-03-03 Feibo Jiang , Siwei Tu , Li Dong , Xiaolong Li , Kezhi Wang , Cunhua Pan , Zhu Han , Jiangzhou Wang

The visual commonsense reasoning (VCR) task is to choose an answer and provide a justifying rationale based on the given image and textural question. Representative works first recognize objects in images and then associate them with key…

Computer Vision and Pattern Recognition · Computer Science 2023-12-27 Jian Zhu , Hanli Wang , Miaojing Shi

Optical Character Recognition (OCR) of eighteenth-century printed texts remains challenging due to degraded print quality, archaic glyphs, and non-standardized orthography. Although transformer-based OCR systems and Vision-Language Models…

Computer Vision and Pattern Recognition · Computer Science 2026-02-17 Ari Vesalainen , Eetu Mäkelä , Laura Ruotsalainen , Mikko Tolonen

High-throughput plant phenotyping, the quantitative measurement of observable plant traits, is critical for modern breeding but remains constrained by a "phenotyping bottleneck," where manual data collection is labor-intensive and prone to…

Computer Vision and Pattern Recognition · Computer Science 2026-05-06 Abderrahmene Boudiaf , Sajd Javed

As Large Language Models (LLMs) rapidly advance, we introduce Hunyuan-TurboS, a novel large hybrid Transformer-Mamba Mixture of Experts (MoE) model. It synergistically combines Mamba's long-sequence processing efficiency with Transformer's…

Computation and Language · Computer Science 2025-07-08 Tencent Hunyuan Team , Ao Liu , Botong Zhou , Can Xu , Chayse Zhou , ChenChen Zhang , Chengcheng Xu , Chenhao Wang , Decheng Wu , Dengpeng Wu , Dian Jiao , Dong Du , Dong Wang , Feng Zhang , Fengzong Lian , Guanghui Xu , Guanwei Zhang , Hai Wang , Haipeng Luo , Han Hu , Huilin Xu , Jiajia Wu , Jianchen Zhu , Jianfeng Yan , Jiaqi Zhu , Jihong Zhang , Jinbao Xue , Jun Xia , Junqiang Zheng , Kai Liu , Kai Zhang , Kai Zheng , Kejiao Li , Keyao Wang , Lan Jiang , Lixin Liu , Lulu Wu , Mengyuan Huang , Peijie Yu , Peiqi Wang , Qian Wang , Qianbiao Xiang , Qibin Liu , Qingfeng Sun , Richard Guo , Ruobing Xie , Saiyong Yang , Shaohua Chen , Shihui Hu , Shuai Li , Shuaipeng Li , Shuang Chen , Suncong Zheng , Tao Yang , Tian Zhang , Tinghao Yu , Weidong Han , Weijie Liu , Weijin Zhou , Weikang Wang , Wesleye Chen , Xiao Feng , Xiaoqin Ren , Xingwu Sun , Xiong Kuang , Xuemeng Huang , Xun Cao , Yanfeng Chen , Yang Du , Zhen Yang , Yangyu Tao , Yaping Deng , Yi Shen , Yigeng Hong , Yiqi Chen , Yiqing Huang , Yuchi Deng , Yue Mao , Yulong Wang , Yuyuan Zeng , Zenan Xu , Zhanhui Kang , Zhe Zhao , ZhenXiang Yan , Zheng Fang , Zhichao Hu , Zhongzhi Chen , Zhuoyu Li , Zongwei Li , Alex Yan , Ande Liang , Baitong Liu , Beiping Pan , Bin Xing , Binghong Wu , Bingxin Qu , Bolin Ni , Boyu Wu , Chen Li , Cheng Jiang , Cheng Zhang , Chengjun Liu , Chengxu Yang , Chengzhong Xu , Chiyu Wang , Chong Zha , Daisy Yi , Di Wang , Fanyang Lu , Fei Chen , Feifei Liu , Feng Zheng , Guanghua Yu , Guiyang Li , Guohua Wang , Haisheng Lin , Han Liu , Han Wang , Hao Fei , Hao Lu , Haoqing Jiang , Haoran Sun , Haotian Zhu , Huangjin Dai , Huankui Chen , Huawen Feng , Huihui Cai , Huxin Peng , Jackson Lv , Jiacheng Shi , Jiahao Bu , Jianbo Li , Jianglu Hu , Jiangtao Guan , Jianing Xu , Jianwei Cai , Jiarong Zhang , Jiawei Song , Jie Jiang , Jie Liu , Jieneng Yang , Jihong Zhang , Jin lv , Jing Zhao , Jinjian Li , Jinxing Liu , Jun Zhao , Juntao Guo , Kai Wang , Kan Wu , Lei Fu , Lei He , Lei Wang , Li Liu , Liang Dong , Liya Zhan , Long Cheng , Long Xu , Mao Zheng , Meng Liu , Mengkang Hu , Nanli Chen , Peirui Chen , Peng He , Pengju Pan , Pengzhi Wei , Qi Yang , Qi Yi , Roberts Wang , Rongpeng Chen , Rui Sun , Rui Yang , Ruibin Chen , Ruixu Zhou , Shaofeng Zhang , Sheng Zhang , Shihao Xu , Shuaishuai Chang , Shulin Liu , SiQi Wang , Songjia Feng , Songling Yuan , Tao Zhang , Tianjiao Lang , Tongkai Li , Wei Deng , Wei Li , Weichao Wang , Weigang Zhang , Weixuan Sun , Wen Ouyang , Wenxiang Jiao , Wenzhi Sun , Wenzhuo Jia , Xiang Zhang , Xiangyu He , Xianshun Ren , XiaoYing Zhu , Xiaolong Guo , Xiaoxue Li , Xiaoyu Ma , Xican Lu , Xinhua Feng , Xinting Huang , Xinyu Guan , Xirui Li , Xu Zhang , Xudong Gao , Xun Luo , Xuxiang Qi , Yangkun Chen , Yangyu Tao , Yanling Xiao , Yantao Mai , Yanze Chen , Yao Ding , Yeting Yang , YiFan Song , Yifan Yang , Yijiao Zhu , Yinhe Wu , Yixian Liu , Yong Yang , Yuanjun Cai , Yuanlin Tu , Yue Zhang , Yufei Huang , Yuhang Zhou , Yuhao Jiang , Yuhong Liu , Yuhui Hu , Yujin Lin , Yun Yang , Yunhao Wang , Yusong Zhang , Zekun Wu , Zelong Zhang , Zhan Yu , Zhaoliang Yang , Zhe Zhao , Zheng Li , Zhenyu Huang , Zhiguang Liu , Zhijiang Xu , Zhiqing Kui , Zhiyin Zeng , Zhiyuan Xiong , Zhuo Han , Zifan Wu , Zigang Geng , Zilong Zhao , Ziyan Tang , Ziyuan Zhu , Zonglei Zhu , Zhijiang Xu

Large language models (LLMs) have notably accelerated progress towards artificial general intelligence (AGI), with their impressive zero-shot capacity for user-tailored tasks, endowing them with immense potential across a range of…

Computer Vision and Pattern Recognition · Computer Science 2023-05-26 Wenhai Wang , Zhe Chen , Xiaokang Chen , Jiannan Wu , Xizhou Zhu , Gang Zeng , Ping Luo , Tong Lu , Jie Zhou , Yu Qiao , Jifeng Dai

The rapid advancement of large vision-language models (LVLMs) has significantly propelled applications in document understanding, particularly in optical character recognition (OCR) and multilingual translation. However, current evaluations…

Machine Learning · Computer Science 2025-05-20 Zhanglin Wu , Tengfei Song , Ning Xie , Mengli Zhu , Weidong Zhang , Shuang Wu , Pengfei Li , Chong Li , Junhao Zhu , Hao Yang , Shiliang Sun

Text recognition is a long-standing research problem for document digitalization. Existing approaches are usually built based on CNN for image understanding and RNN for char-level text generation. In addition, another language model is…

Computation and Language · Computer Science 2022-09-07 Minghao Li , Tengchao Lv , Jingye Chen , Lei Cui , Yijuan Lu , Dinei Florencio , Cha Zhang , Zhoujun Li , Furu Wei

Current remote sensing vision-language models (RS VLMs) demonstrate impressive performance in image interpretation but rely on static training data, limiting their ability to accommodate continuously emerging sensing modalities and…

Computer Vision and Pattern Recognition · Computer Science 2026-04-02 Xingxing Weng , Ruifeng Ni , Chao Pang , XiangYu Hao , Yishan Wang , Xiaokang Zhang , Wei Xu , Gui-Song Xia

Large Vision-Language Models (LVLMs) encode visual inputs as dense sequences of patch-level tokens to capture fine-grained semantics. These visual tokens often outnumber their textual counterparts by a large margin, leading to substantial…

Computer Vision and Pattern Recognition · Computer Science 2026-03-03 Rui Xu , Yunke Wang , Yong Luo , Bo Du

Aerial Vision-and-Language Navigation (VLN) aims to enable unmanned aerial vehicles (UAVs) to interpret natural language instructions and navigate complex urban environments using onboard visual observation. This task holds promise for…

Computer Vision and Pattern Recognition · Computer Science 2026-04-16 Huilin Xu , Zhuoyang Liu , Yixiang Luomei , Feng Xu

Large pre-trained vision-language models (VLMs) offer a promising approach to leveraging human language for enhancing downstream tasks. However, VLMs such as CLIP face significant limitation: its performance is highly sensitive to prompt…

Computer Vision and Pattern Recognition · Computer Science 2025-03-13 Ao Li , Zongfang Liu , Xinhua Li , Jinghui Zhang , Pengwei Wang , Hu Wang

Automating high-volume unstructured data processing is essential for operational efficiency. Optical Character Recognition (OCR) is critical but often struggles with accuracy and efficiency in complex layouts and ambiguous text. These…

Robotics · Computer Science 2025-04-29 Osama Abdellatif , Ahmed Ayman , Ali Hamdi

The remarkable reasoning capability of large language models (LLMs) stems from cognitive behaviors that emerge through reinforcement with verifiable rewards. This work investigates how to transfer this principle to Multimodal LLMs (MLLMs)…

Computer Vision and Pattern Recognition · Computer Science 2025-09-23 Yana Wei , Liang Zhao , Jianjian Sun , Kangheng Lin , Jisheng Yin , Jingcheng Hu , Yinmin Zhang , En Yu , Haoran Lv , Zejia Weng , Jia Wang , Chunrui Han , Yuang Peng , Qi Han , Zheng Ge , Xiangyu Zhang , Daxin Jiang , Vishal M. Patel

Maritime port inspection plays a critical role in ensuring safety, regulatory compliance, and operational efficiency in complex maritime environments. However, existing inspection methods often rely on manual operations and conventional…

Robotics · Computer Science 2026-01-21 Muhayy Ud Din , Waseem Akram , Ahsan B. Bakht , Irfan Hussain

This paper presents a novel training-free framework for open-vocabulary image segmentation and object recognition (OVSR), which leverages EfficientNetB0, a convolutional neural network, for unsupervised segmentation and CLIP, a…

Computer Vision and Pattern Recognition · Computer Science 2025-10-28 Ying Dai , Wei Yu Chen

Recent advancements in Vision-Language (VL) research have sparked new benchmarks for complex visual reasoning, challenging models' advanced reasoning ability. Traditional Vision-Language Models (VLMs) perform well in visual perception tasks…

Computer Vision and Pattern Recognition · Computer Science 2024-09-24 Zhiyuan Li , Dongnan Liu , Chaoyi Zhang , Heng Wang , Tengfei Xue , Weidong Cai

Aligning visual features with language embeddings is a key challenge in vision-language models (VLMs). The performance of such models hinges on having a good connector that maps visual features generated by a vision encoder to a shared…

We present ZAYA1-VL-8B, a compact mixture-of-experts vision-language model built upon our in-house language model, ZAYA1-8B. Despite its compact size, ZAYA1-VL achieves performance competitive with leading base models such as Molmo2-4B and…

Computer Vision and Pattern Recognition · Computer Science 2026-05-12 Hassan Shapourian , Kasra Hejazi , Olabode M. Sule , Beren Millidge

Reinforcement learning (RL) requires either manually specifying a reward function, which is often infeasible, or learning a reward model from a large amount of human feedback, which is often very expensive. We study a more sample-efficient…

Machine Learning · Computer Science 2024-03-15 Juan Rocamonde , Victoriano Montesinos , Elvis Nava , Ethan Perez , David Lindner
‹ Prev 1 8 9 10 Next ›