第二支羽毛

强化自训练（ReST）：让大语言模型更懂你的“心” 强化自我训练（Reinforced Self-Training，ReST）是一种简单的算法，它能让大语言模型（LLM）的输出更符合人类的偏好。这种算法的灵感来源于不断发展的批量强化学习（RL）。简单来说，先给大语言模型设定一个初始策略，ReST就可

基础模型

DeepSeek-R1的顿悟时刻是如何出现的？背后的数学原理：强化学习如何教大型语言模型进行推理

DeepSeek-R1的顿悟时刻是如何出现的？背后的数学原理：强化学习如何教大型语言模型进行推理 DeepSeek-R1的卓越表现 DeepSeek-R1的开创性论文《DeepSeek-R1：通过强化学习激励大语言模型（LLMs）的推理能力》，对其性能进行了全面分析，结果令人惊叹。在标准语言模型基

强化学习

强化学习中的关键模型与算法：从Actor-Critic到GRPO

强化学习

强化学习中的关键模型与算法：从Actor-Critic到GRPO 强化学习中的Actor-Critic模型是什么？这与生成对抗网络（GANs）十分相似。在生成对抗网络中，生成器和判别器模型在整个训练过程中相互对抗。在强化学习的Actor-Critic模型中，也存在类似的概念： Actor-Crit

DeepSeek-R1：通过强化学习激发大语言模型的推理潜能

DeepSeek-R1：通过强化学习激发大语言模型的推理潜能在本文中，我们将深入探索DeepSeek-R1背后的前沿进展与创新方法。这一成果作为提升大语言模型（LLMs）推理能力的卓越方案，融合了强化学习（RL）等前沿技术，不仅革新了模型训练范式，还为行业发展开辟了新方向。接下来，让我们一同揭开D

强化学习

深度探索：DeepSeek-R1 如何从零开始训练，以及这项开源研究将如何以前所未有的速度推动 AI 进步

近日热文：全网最全的神经网络数学原理（代码和公式）直观解释欢迎关注知乎和公众号的专栏内容 LLM架构专栏

开源