Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

🧠 Part 9: 推荐中的思考与推理

让推荐模型从「隐式预测器」进化为「显式推理者」——统一语义、激活思考、走向自主。

📚 3 节 · ⏱️ Estimated 1.5 weeks · 🎯 Target: 理解 LLM 推荐的语义对齐与显式推理范式

当生成式推荐(参见 1.1、5.3)让模型学会「直接生成」物品序列后,一个更本质的问题浮现:模型 真的在思考 吗?传统推荐模型只是隐式打分或隐式生成的「黑箱」,我们既不知道它依据哪些信号做判断,也无法向用户解释「为什么推荐这个」。本部分沿「从表征到推理、从模仿到自主」的递进逻辑,展示让推荐系统真正「会思考」的三步跃迁。

本部分沿「从表征到推理、从模仿到自主」的三步递进展开:先解决 语义鸿沟 (LC-Rec/PLUM 把物品变成 LLM 可理解的语义索引),再让模型 先思考再推荐 (OneRec-Think 的显式推理链),最后探索 自主推理 (RecZero/RecOne 摆脱人工模板)。各章要点见下表。


本章涵盖

章节TopicThe Big Idea
9.1协同语义与语言语义的统一用层次化语义索引(RQ-VAE)+ 三层对齐,把物品 ID 与语言语义空间打通;PLUM 推进到工业级多模态规模
9.2OneRec-Think 的推理框架三阶段训练(对齐→激活→增强),让模型生成结构化推理链;用 GRPO 与 Think-Ahead 解决质量与延迟
9.3自主推理的探索RecZero 纯强化学习自主摸索推理;RecOne 混合范式兼顾效率与性能上界

What You'll Be Able to Do After This Part

  • 🟢 解释 协同语义与语言语义的鸿沟,以及为什么「直接用标题替换 ID」不足以解决它
  • 🟢 描述LC-Rec 的层次化 RQ-VAE 语义索引与均匀语义映射(最优传输)如何避免索引冲突
  • 🟡 复述OneRec-Think 三阶段框架,并说明推理脚手架如何「激活」显式推理
  • 🟡 辨析 推荐特定奖励与 GRPO 如何应对推荐的「多有效性」特性
  • 🔴 对比OneRec-Think(模仿学习)、RecZero(纯 RL)、RecOne(混合)三种推理范式的取舍
  • 完成各节分层练习题,巩固从语义对齐到自主推理的演进主线

核心概念

Concept章节Relevance
语义索引 / 语义 ID9.1让 LLM 既能理解物品、又承载协同信号的表示基石
均匀语义映射 / 最优传输9.1工业级规模下避免索引冲突的关键机制
推理脚手架 / 显式推理9.2把黑箱决策变成可审查推理链的核心
多有效性 + GRPO9.2适配「无唯一正确答案」的推荐强化学习
自主推理 / 混合范式9.3摆脱人工模板、走向自主思考的演进方向

前置知识

  • 已读 1.1(两种范式与能力演进)、5.3(生成式范式演进,尤其 TIGER 语义 ID 与 OneRec 端到端生成)
  • 了解基础概率、向量量化(RQ-VAE)与 Transformer 微调(指令微调 / SFT)概念

本部分偏前沿,公式较多但重在直觉——不必逐行推导,抓住「为什么这样设计」即可。


Tips for This Part

  1. 把语义索引当作「翻译层」。 它是连接协同世界与语言世界的桥梁,后面所有推理都建立在它之上。
  2. 区分「会生成」与「会思考」。 5.3 的 OneRec 会生成,但 OneRec-Think 才会解释——这是 9.2 的灵魂。
  3. 用「模仿 → 自主」的弧线贯穿 9.3。 RecZero/RecOne 不是推翻 OneRec-Think,而是把「思考能力」从人工模板中解放出来。

Let's dive in! 🚀