Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

📗 Part 5: 前沿趋势

越过三阶段流水线的工程实现,看清推荐系统正在被修正、被补全、被重塑的三股力量。

📚 3 节 · ⏱️ Estimated 3–4 days · 🎯 Target: 理解去偏、冷启动与生成式三大前沿方向

前三篇带你走完了判别式推荐的完整工业链路——召回、排序、重排。但真实的推荐系统远不止「把候选排好序」这么简单。它还要面对 有偏的数据没有历史的物品与用户 ,以及一场正在发生的 范式跃迁 :从「给每个候选打分」走向「直接生成推荐序列」。

本部分不再新增某个独立算法模块,而是把镜头拉高,看清楚工业界与学术界在 修正、补全、重塑 推荐系统时的三种思路。


本章涵盖

章节TopicThe Big Idea
5.1模型去偏数据天然有偏且存在反馈闭环,用 IPS 加权与 PAL 解耦位置来矫正
5.2冷启动用内容/元学习/分群架构,为没有历史的物品与用户生成有效表示
5.3生成式范式演进从判别式打分到生成式序列生成,串起记忆·泛化 → 理解·推理的跃迁

What You'll Be Able to Do After This Part

  • 🟢 解释 推荐系统数据偏差的来源(选择/曝光/从众/位置)与结果偏差(流行度/不公平)如何经反馈闭环被放大
  • 🟢 应用 逆倾向得分(IPS)重新加权,并用 PAL 在结构上解耦位置效应与用户偏好
  • 🟡 辨析 内容冷启动(CB2CF / MetaEmbedding)与用户冷启动(MeLU / POSO)的不同解法
  • 🟡 描述 生成式推荐的三大演进路径:生成式召回(HSTU / TIGER)、生成式排序(GenRank / MTGR)、端到端统一生成(OneRec)
  • 🔴 对照 Part 1 的两种范式,论证判别式级联架构如何被生成式端到端架构替代

核心概念

Concept章节Relevance
选择偏差 / 曝光偏差 / 位置偏差5.1训练数据不可信的根源,需主动纠偏
逆倾向得分 IPS5.1 加权,得到无偏风险估计
位置感知学习 PAL5.1把「看到」与「喜欢」在结构上分离
内容冷启动 CB2CF / MetaEmbedding5.2让新物品借内容获得协同表示
用户冷启动 MeLU / POSO5.2用元学习或分群子模块服务新用户
语义 ID / 端到端生成5.3生成式推荐的核心:理解内容、直接生成

前置知识

  • 已读完 Part 1 的两种范式与三阶段漏斗
  • 了解 Part 2 召回与 Part 3 排序的基本模型(协同过滤、双塔、矩阵分解)
  • 具备基础的深度学习与序列模型概念(Transformer 自注意力、元学习 MAML 会有助于 5.2/5.3 理解)

本部分是基础篇的「承上启下」收尾——它既修补前文流水线的缺陷,又指向后续版本的生成式下篇。


Tips for This Part

  1. 把偏差当成「看不见的对手」。 读到 5.1 时,时刻问:这个训练样本,真的代表用户的真实偏好吗?
  2. 冷启动的核心是「借力」。 新物品没有行为,就借内容;新用户没有历史,就借元知识或人群结构。
  3. 5.3 要回头呼应 Part 1。 它把「判别式 vs 生成式」从概念落到了具体模型(HSTU、TIGER、OneRec)。

Let's dive in! 🚀