第二支羽毛|吹灭读书灯，一身都是月

探索ModernBERT：传统BERT模型的重大升级

探索ModernBERT：传统BERT模型的重大升级这次我们聚焦于ModernBERT，看看它是如何强化上下文嵌入的应用。我们还会讲讲如何生成用于微调的数据集，并展示怎样对ModernBERT进行微调，从而在自然语言处理（NLP）任务中取得更强大的效果。嵌入在机器学习和NLP中的重要性嵌入是机

基础模型

一文读懂自动编码器：类型、原理与应用

一文读懂自动编码器：类型、原理与应用近日热文：全网最全的神经网络数学原理（代码和公式）直观解释欢迎关注知乎和公众号的专栏内容 LLM架构专栏知乎LLM专栏

理论基础

缓存增强生成（CAG）对比检索增强生成（RAG）：谁才是大语言模型的最优解？

缓存增强生成（CAG）对比检索增强生成（RAG）：谁才是大语言模型的最优解？ 1. 前期准备：RAG与KV-Cache（CAG） RAG 是什么 RAG是一种检索增强生成方法，它利用检索器查找相关文档，然后将这些文档传递给大语言模型，以生成最终答案。优势处理大型或频繁更新的数据集时，无需一次性加

RAG

ReaderLM v2：前沿小型语言模型，实现HTML到Markdown和JSON的转换

ReaderLM v2：前沿小型语言模型，实现HTML到Markdown和JSON的转换 ReaderLM的第二代是一款拥有15亿参数的语言模型，它能将原始HTML转换为格式精美的Markdown或JSON，准确率极高，并且在处理更长文本上下文方面表现更佳。ReaderLM-v2的输入和输出总长度支

基础模型

重现 OpenAI o1 的技术路线

重现 OpenAI o1 的技术路线 OpenAI o1发布后，其强大的推理能力远超早期的大语言模型（LLM），达到了媲美博士级专业知识的性能水平。目前，有两种复现o1的范式：基于知识蒸馏：这是一种捷径方法，可以提取o1的数据并微调LLM（如Llama 3.2、Qwen2等）以模仿o1的推理风格

LLM架构

典型的RAG流程、每个模块的最佳实践和综合评估

典型的RAG流程、每个模块的最佳实践和综合评估近日热文：全网最全的神经网络数学原理（代码和公式）直观解释欢迎关注知乎和公众号的专栏内容 LLM架构专栏知乎LLM专栏

RAG

加速大模型推理：深入探究MQA、GQA、MLA（DeepSeek）、KV缓存技术

加速大模型推理：深入探究MQA、GQA、MLA（DeepSeek）、KV缓存技术回顾：多头注意力机制为什么LLM推理是串行的 KV缓存的挑战 2019年——多查询注意力机制（Multi Query Attention） 2023年5月——分组查询注意力机制（Grouped Query Atten

LLM架构

强化自训练（ReST）：让大语言模型更懂你的“心”

强化自训练（ReST）：让大语言模型更懂你的“心” 强化自我训练（Reinforced Self-Training，ReST）是一种简单的算法，它能让大语言模型（LLM）的输出更符合人类的偏好。这种算法的灵感来源于不断发展的批量强化学习（RL）。简单来说，先给大语言模型设定一个初始策略，ReST就可

基础模型

Qwen2.5-Max：对标DeepSeek V3

Qwen2.5-Max：对标DeepSeek V3 Qwen2.5-Max：阿里巴巴挑战DeepSeek V3的新AI巨头大语言模型（LLMs）彻底改变了AI领域，实现了从聊天机器人到复杂推理系统等众多应用。这些模型依赖大量数据和计算能力，随着规模的扩大，它们的能力也在不断提升。这一进步背后的关键

开源

DeepSeek-R1的顿悟时刻是如何出现的？背后的数学原理：强化学习如何教大型语言模型进行推理

DeepSeek-R1的顿悟时刻是如何出现的？背后的数学原理：强化学习如何教大型语言模型进行推理 DeepSeek-R1的卓越表现 DeepSeek-R1的开创性论文《DeepSeek-R1：通过强化学习激励大语言模型（LLMs）的推理能力》，对其性能进行了全面分析，结果令人惊叹。在标准语言模型基

强化学习