当生成式推荐(参见 1.1、5.3)让模型学会「直接生成」物品序列后,一个更本质的问题浮现:模型 真的在思考 吗?传统推荐模型只是隐式打分或隐式生成的「黑箱」,我们既不知道它依据哪些信号做判断,也无法向用户解释「为什么推荐这个」。本部分沿「从表征到推理、从模仿到自主」的递进逻辑,展示让推荐系统真正「会思考」的三步跃迁。
本部分沿「从表征到推理、从模仿到自主」的三步递进展开:先解决 语义鸿沟 (LC-Rec/PLUM 把物品变成 LLM 可理解的语义索引),再让模型 先思考再推荐 (OneRec-Think 的显式推理链),最后探索 自主推理 (RecZero/RecOne 摆脱人工模板)。各章要点见下表。
本章涵盖
| 章节 | Topic | The Big Idea |
|---|---|---|
| 9.1 | 协同语义与语言语义的统一 | 用层次化语义索引(RQ-VAE)+ 三层对齐,把物品 ID 与语言语义空间打通;PLUM 推进到工业级多模态规模 |
| 9.2 | OneRec-Think 的推理框架 | 三阶段训练(对齐→激活→增强),让模型生成结构化推理链;用 GRPO 与 Think-Ahead 解决质量与延迟 |
| 9.3 | 自主推理的探索 | RecZero 纯强化学习自主摸索推理;RecOne 混合范式兼顾效率与性能上界 |
What You'll Be Able to Do After This Part
- 🟢 解释 协同语义与语言语义的鸿沟,以及为什么「直接用标题替换 ID」不足以解决它
- 🟢 描述LC-Rec 的层次化 RQ-VAE 语义索引与均匀语义映射(最优传输)如何避免索引冲突
- 🟡 复述OneRec-Think 三阶段框架,并说明推理脚手架如何「激活」显式推理
- 🟡 辨析 推荐特定奖励与 GRPO 如何应对推荐的「多有效性」特性
- 🔴 对比OneRec-Think(模仿学习)、RecZero(纯 RL)、RecOne(混合)三种推理范式的取舍
- 完成各节分层练习题,巩固从语义对齐到自主推理的演进主线
核心概念
| Concept | 章节 | Relevance |
|---|---|---|
| 语义索引 / 语义 ID | 9.1 | 让 LLM 既能理解物品、又承载协同信号的表示基石 |
| 均匀语义映射 / 最优传输 | 9.1 | 工业级规模下避免索引冲突的关键机制 |
| 推理脚手架 / 显式推理 | 9.2 | 把黑箱决策变成可审查推理链的核心 |
| 多有效性 + GRPO | 9.2 | 适配「无唯一正确答案」的推荐强化学习 |
| 自主推理 / 混合范式 | 9.3 | 摆脱人工模板、走向自主思考的演进方向 |
前置知识
- 已读 1.1(两种范式与能力演进)、5.3(生成式范式演进,尤其 TIGER 语义 ID 与 OneRec 端到端生成)
- 了解基础概率、向量量化(RQ-VAE)与 Transformer 微调(指令微调 / SFT)概念
本部分偏前沿,公式较多但重在直觉——不必逐行推导,抓住「为什么这样设计」即可。
Tips for This Part
- 把语义索引当作「翻译层」。 它是连接协同世界与语言世界的桥梁,后面所有推理都建立在它之上。
- 区分「会生成」与「会思考」。 5.3 的 OneRec 会生成,但 OneRec-Think 才会解释——这是 9.2 的灵魂。
- 用「模仿 → 自主」的弧线贯穿 9.3。 RecZero/RecOne 不是推翻 OneRec-Think,而是把「思考能力」从人工模板中解放出来。
Let's dive in! 🚀