MODULE // PAPERS

论文研读

AI 前沿论文 · 中文科普精读 · 详情页可就本篇提问

推理

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

DAPO 提出了一套完全开源的、基于强化学习的大语言模型推理能力训练系统,在 Qwen2.5-32B 基座模型上通过解耦裁剪与动态采样策略,在 AIME 2024 数学竞赛题上达到 50 分,并公开了算法细节、训练代码与数据集。

阅读精读 →
推荐系统

Flow Matching for Collaborative Filtering

这篇论文提出 FlowCF,将连续标准化流(Flow Matching)引入协同过滤推荐系统,通过行为引导先验和离散流框架,在保持训练稳定性和推理速度的同时,显著提升推荐精度。

阅读精读 →
推理

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

本文提出 DeepSeek-R1,证明仅通过强化学习(RL)即可激发大语言模型的推理能力,无需依赖人工标注的推理轨迹,模型在数学、编程等可验证任务上超越传统监督学习方法,并自发涌现出自我反思、验证和动态策略调整等高级推理模式。

阅读精读 →
注意力

MiniMax-01: Scaling Foundation Models with Lightning Attention

MiniMax-01 系列模型(包括纯文本版 MiniMax-Text-01 和视觉语言版 MiniMax-VL-01)通过引入名为“闪电注意力”(Lightning Attention)的新型注意力机制,结合混合专家架构(MoE),在 4560 亿总参数(每 token 激活 459 亿)的规模下,实现了与 GPT-

阅读精读 →
大模型

DeepSeek-V3 Technical Report

DeepSeek-V3 是一个拥有 6710 亿总参数、每个 token 仅激活 370 亿参数的混合专家(MoE)大语言模型,在 14.8 万亿 token 上完成预训练,训练仅消耗 278.8 万 H800 GPU 小时,性能超越所有开源模型,并可与 GPT-4 等顶级闭源模型媲美。

阅读精读 →