Semantic Scholar Open Access 2025 5344 sitasi

DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning

DeepSeek-AI Daya Guo Dejian Yang Haowei Zhang Jun-Mei Song +193 lainnya

Abstrak

General reasoning represents a long-standing and formidable challenge in artificial intelligence (AI). Recent breakthroughs, exemplified by large language models (LLMs)1,2 and chain-of-thought (CoT) prompting3, have achieved considerable success on foundational reasoning tasks. However, this success is heavily contingent on extensive human-annotated demonstrations and the capabilities of models are still insufficient for more complex problems. Here we show that the reasoning abilities of LLMs can be incentivized through pure reinforcement learning (RL), obviating the need for human-labelled reasoning trajectories. The proposed RL framework facilitates the emergent development of advanced reasoning patterns, such as self-reflection, verification and dynamic strategy adaptation. Consequently, the trained model achieves superior performance on verifiable tasks such as mathematics, coding competitions and STEM fields, surpassing its counterparts trained through conventional supervised learning on human demonstrations. Moreover, the emergent reasoning patterns exhibited by these large-scale models can be systematically used to guide and enhance the reasoning capabilities of smaller models. A new artificial intelligence model, DeepSeek-R1, is introduced, demonstrating that the reasoning abilities of large language models can be incentivized through pure reinforcement learning, removing the need for human-annotated demonstrations.

Topik & Kata Kunci

Medicine Computer Science

Penulis (198)

DeepSeek-AI

Daya Guo

Dejian Yang

Haowei Zhang

Jun-Mei Song

Ruoyu Zhang

R. Xu

Qihao Zhu

Shirong Ma

Peiyi Wang

Xiaoling Bi

Xiaokang Zhang

Xingkai Yu

Yu Wu

Z. F. Wu

Zhibin Gou

Zhihong Shao

Zhuoshu Li

Ziyi Gao

A. Liu

Bing Xue

Bing-Li Wang

Bochao Wu

B. Feng

Chengda Lu

Chenggang Zhao

C. Deng

Chenyu Zhang

C. Ruan

Damai Dai

Deli Chen

Dong-Li Ji

Erhang Li

Fangyun Lin

Fucong Dai

Fuli Luo

Guangbo Hao

Guanting Chen

Guowei Li

H. Zhang

Han Bao

Hanwei Xu

Haocheng Wang

Honghui Ding

Huajian Xin

Huazuo Gao

Hui Qu

Hui Li

Jianzhong Guo

Jiashi Li

Jiawei Wang

JingChang Chen

Jingyang Yuan

Junjie Qiu

Junlong Li

J. Cai

J. Ni

Jian Liang

Jin Chen

Kai Dong

Kai Hu

Kaige Gao

Kang Guan

Kexin Huang

K. Yu

Lean Wang

Lecong Zhang

Liang Zhao

Litong Wang

Liyue Zhang

Lei Xu

Leyi Xia

Mingchuan Zhang

Minghua Zhang

M. Tang

Meng Li

Miaojun Wang

Mingming Li

Ning Tian

Panpan Huang

Peng Zhang

Qiancheng Wang

Qinyu Chen

Qiushi Du

Ruiqi Ge

Ruisong Zhang

Ruizhe Pan

Runji Wang

R. J. Chen

R. Jin

Ruyi Chen

Shanghao Lu

Shangyan Zhou

Shanhuang Chen

Shengfeng Ye

Shiyu Wang

Shuiping Yu

Shunfeng Zhou

Shuting Pan

S. Li

Shuang Zhou

Shao-Kang Wu

Tao Yun

Tian Pei

T. Sun

T. Wang

Wangding Zeng

Wanjia Zhao

Wen Liu

W. Liang

Wenjun Gao

Wen-Xia Yu

Wentao Zhang

W. Xiao

Wei An

Xiaodong Liu

Xiaohan Wang

Xiaokang Chen

X. Nie

Xin Cheng

Xin Liu

Xin Xie

Xingchao Liu

Xinyu Yang

Xinyuan Li

Xuecheng Su

Xuheng Lin

X. Q. Li

Xiangyu Jin

Xi-Cheng Shen

Xiaosha Chen

Xiaowen Sun

Xiaoxiang Wang

Xinnan Song

Xinyi Zhou

Xianzu Wang

Xinxia Shan

Y. K. Li

Y. Q. Wang

Y. X. Wei

Yang Zhang

Yanhong Xu

Yao Li

Yao Zhao

Yaofeng Sun

Yaohui Wang

Yi Yu

Yichao Zhang

Yifan Shi

Yi Xiong

Ying He

Y. Piao

Yisong Wang

Yixuan Tan

Yiyang Ma

Yiyuan Liu

Yongqiang Guo

Y. Ou

Yuduan Wang

Yue Gong

Yu-Jing Zou

Yujia He

Yunfan Xiong

Yu-Wei Luo

Yu-mei You

Yuxuan Liu

Yuyang Zhou

Y. X. Zhu

Yanping Huang

Yao Li

Yi Zheng

Yuchen Zhu

Yunxiang Ma

Ying Tang

Y. Zha

Yuting Yan

Z. Ren

Zhangli Sha

Zhe Fu

Zhean Xu

Zhenda Xie

Zhen-guo Zhang

Zhewen Hao

Zhicheng Ma

Zhigang Yan

Zhiyu Wu

Zihui Gu

Zijia Zhu

Zijun Liu

Zi-An Li

Ziwei Xie

Ziyang Song

Zizheng Pan

Zhen Huang

Zhipeng Xu

Zhongyu Zhang

Zhen Zhang

Format Sitasi

APA MLA BibTeX

DeepSeek-AI, Guo, D., Yang, D., Zhang, H., Song, J., Zhang, R. et al. (2025). DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning. https://doi.org/10.1038/s41586-025-09422-z

@article{deepseek-ai2025, author = {DeepSeek-AI and Daya Guo and Dejian Yang and Haowei Zhang and Jun-Mei Song and Ruoyu Zhang and R. Xu and Qihao Zhu and Shirong Ma and Peiyi Wang and Xiaoling Bi and Xiaokang Zhang and Xingkai Yu and Yu Wu and Z. F. Wu and Zhibin Gou and Zhihong Shao and Zhuoshu Li and Ziyi Gao and A. Liu and Bing Xue and Bing-Li Wang and Bochao Wu and B. Feng and Chengda Lu and Chenggang Zhao and C. Deng and Chenyu Zhang and C. Ruan and Damai Dai and Deli Chen and Dong-Li Ji and Erhang Li and Fangyun Lin and Fucong Dai and Fuli Luo and Guangbo Hao and Guanting Chen and Guowei Li and H. Zhang and Han Bao and Hanwei Xu and Haocheng Wang and Honghui Ding and Huajian Xin and Huazuo Gao and Hui Qu and Hui Li and Jianzhong Guo and Jiashi Li and Jiawei Wang and JingChang Chen and Jingyang Yuan and Junjie Qiu and Junlong Li and J. Cai and J. Ni and Jian Liang and Jin Chen and Kai Dong and Kai Hu and Kaige Gao and Kang Guan and Kexin Huang and K. Yu and Lean Wang and Lecong Zhang and Liang Zhao and Litong Wang and Liyue Zhang and Lei Xu and Leyi Xia and Mingchuan Zhang and Minghua Zhang and M. Tang and Meng Li and Miaojun Wang and Mingming Li and Ning Tian and Panpan Huang and Peng Zhang and Qiancheng Wang and Qinyu Chen and Qiushi Du and Ruiqi Ge and Ruisong Zhang and Ruizhe Pan and Runji Wang and R. J. Chen and R. Jin and Ruyi Chen and Shanghao Lu and Shangyan Zhou and Shanhuang Chen and Shengfeng Ye and Shiyu Wang and Shuiping Yu and Shunfeng Zhou and Shuting Pan and S. Li and Shuang Zhou and Shao-Kang Wu and Tao Yun and Tian Pei and T. Sun and T. Wang and Wangding Zeng and Wanjia Zhao and Wen Liu and W. Liang and Wenjun Gao and Wen-Xia Yu and Wentao Zhang and W. Xiao and Wei An and Xiaodong Liu and Xiaohan Wang and Xiaokang Chen and X. Nie and Xin Cheng and Xin Liu and Xin Xie and Xingchao Liu and Xinyu Yang and Xinyuan Li and Xuecheng Su and Xuheng Lin and X. Q. Li and Xiangyu Jin and Xi-Cheng Shen and Xiaosha Chen and Xiaowen Sun and Xiaoxiang Wang and Xinnan Song and Xinyi Zhou and Xianzu Wang and Xinxia Shan and Y. K. Li and Y. Q. Wang and Y. X. Wei and Yang Zhang and Yanhong Xu and Yao Li and Yao Zhao and Yaofeng Sun and Yaohui Wang and Yi Yu and Yichao Zhang and Yifan Shi and Yi Xiong and Ying He and Y. Piao and Yisong Wang and Yixuan Tan and Yiyang Ma and Yiyuan Liu and Yongqiang Guo and Y. Ou and Yuduan Wang and Yue Gong and Yu-Jing Zou and Yujia He and Yunfan Xiong and Yu-Wei Luo and Yu-mei You and Yuxuan Liu and Yuyang Zhou and Y. X. Zhu and Yanping Huang and Yao Li and Yi Zheng and Yuchen Zhu and Yunxiang Ma and Ying Tang and Y. Zha and Yuting Yan and Z. Ren and Z. Ren and Zhangli Sha and Zhe Fu and Zhean Xu and Zhenda Xie and Zhen-guo Zhang and Zhewen Hao and Zhicheng Ma and Zhigang Yan and Zhiyu Wu and Zihui Gu and Zijia Zhu and Zijun Liu and Zi-An Li and Ziwei Xie and Ziyang Song and Zizheng Pan and Zhen Huang and Zhipeng Xu and Zhongyu Zhang and Zhen Zhang}, title = {DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning}, year = {2025}, journal = {Semantic Scholar}, doi = {10.1038/s41586-025-09422-z}, url = {https://www.semanticscholar.org/paper/2eed1fad9bbf887d4395de40f20144c4fafefd7f}, }

Akses Cepat

PDF tidak tersedia langsung

Cek di sumber asli →

Lihat di Sumber doi.org/10.1038/s41586-025-09422-z

Informasi Jurnal

Tahun Terbit: 2025
Bahasa: en
Total Sitasi: 5344×
Sumber Database: Semantic Scholar
DOI: 10.1038/s41586-025-09422-z
Akses: Open Access ✓