推荐系统是现代互联网最核心的基础设施之一,但其内部逻辑远比「帮用户找内容」复杂。本部分先帮你建立 立体的认知框架 :从微观的两种范式,到工业的两条技术路线,再到宏观的生态平衡;最后再落到工程底座,理解业务字段如何变成模型可用的特征与 Embedding。
本章涵盖
| 章节 | Topic | The Big Idea |
|---|---|---|
| 1.1 | 推荐系统是什么 | 从「判别式 vs 生成式」双范式、三阶段流水线、生态三角三个层次理解推荐 |
| 1.2 | 本书概览与技术地图 | 沿判别式与生成式两条主线,串起从记忆·泛化到理解·推理的能力演进 |
| 1.3 | 特征与 Embedding 入门 | 从 slotId / featureSign / value 出发,打通业务字段、特征表达、Embedding 与线上工程边界 |
What You'll Be Able to Do After This Part
- 🟢 描述 推荐问题的两种根本范式(判别式打分 vs 生成式序列生成)及其核心公式
- 🟢 解释 工业级推荐为何采用「召回—排序—重排」三阶段漏斗,以及各阶段的职责
- 🟡 辨析 端到端生成式架构如何消解级联架构的目标不一致、信息损失与计算碎片化
- 🟡 对照 本书的技术地图,定位后续每一章在「能力演进」曲线上的位置
- 🟡 解释 业务字段如何经
slotId / featureSign / value进入模型,并区分 Sparse、Dense、分桶与 Embedding
核心概念
| Concept | 章节 | Relevance |
|---|---|---|
| 判别式推荐 / 生成式推荐 | 1.1 | 贯穿全书的两条主线,决定架构与优化目标 |
| 三阶段流水线(召回/排序/重排) | 1.1 | 判别式推荐的工业骨架 |
| 端到端生成 | 1.1 | 生成式推荐对级联架构的替代 |
| 生态三角(用户/创作者·内容·平台) | 1.1 | 跳出技术指标,理解系统的长期价值 |
| 特征三元组 / Feature Hashing | 1.3 | 连接业务字段与模型输入的工程协议 |
| Sparse / Dense / 分桶 / Embedding | 1.3 | 后续召回、排序与特征交叉模型的表示基础 |
前置知识
- 具备基础机器学习概念(监督学习、概率、向量表示)
- 了解基本的 Python 与神经网络常识
无需推荐系统前置知识——本部分正是为初学者建立的起点。
Tips for This Part
- 先建立框架,再抠细节。 前两节重在「认知地图」,具体算法在后续 Part 逐步展开。
- 对比着读两种范式。 每遇到一个新模型,先判断它属于判别式还是生成式。
- 记住三阶段漏斗。 它是后续 Part 2–4 的组织线索。
- 把 1.3 当作表示基础。 后续看到 Embedding、特征交叉或向量拼接时,随时回到
slotId / featureSign / value检查信息究竟放在哪里。
Let's dive in! 🚀