个性化不是“更准确地猜出用户是谁”,而是“在当下任务里,判断哪一步最可能帮到她——包括什么都不做”。如果系统只学习点击,它会越来越擅长制造点击;只有把任务结果、不确定性、隐私授权和人工接管一起放进决策,个性化才可能从推荐文案升级为增长能力。对 Momcozy APP,最值得先做的不是一个覆盖所有旅程的“用户画像大脑”,而是一条窄场景、可解释、允许不动作的决策策略。
产品为什么需要个性化?因为同一句提醒、同一个帮助入口,对不同任务时刻可能完全相反:第一次绑定前看到权限说明可能有用;正在连续失败时再看到泛化新手教程,可能只会增加挫败;问题已经解决后继续召回,更是在打扰。
Contextual Personalization(情境化个性化),大白话是:系统结合“这个人此刻正在做什么、刚刚发生了什么、有哪些动作被允许”,从少数候选动作中选一个更合适的下一步。生活类比是医院分诊。分诊不是先猜患者属于哪种人格,而是根据当前症状、严重度和不确定性,决定等待、普通门诊、急诊还是请医生立即接管。有时最正确的建议就是不要自行处理。
这里有三个容易混淆的层次。第一层是 Segmentation(分群):预先把相似旅程归在一起,例如“连续绑定失败两次”。第二层是 Recommendation(推荐):在候选内容或动作中排序。第三层是 Decision Policy(决策策略):把资格、上下文、风险、预期结果和不动作条件一起写成规则或模型。真正的增长决策系统需要第三层,而不只是“给不同人写不同文案”。
Momcozy 的待验证例子:同样是“绑定未完成”,有人还没开始,有人因权限失败,有人已经连接但结果事件丢失。统一发绑定提醒,只是粗分群;若系统能识别当前失败节点、置信度和风险,在“步骤内诊断、显示对应帮助、建议稍后重试、转人工、不动作”中做受限选择,才接近情境化决策。
Netflix:不是每个行为都同样代表偏好
个性化的基础不是把所有点击塞进模型,而是先决定哪些行为代表价值、怎样保留长期情境,以及如何处理没有历史的新对象。
Netflix 技术团队披露,其推荐系统服务于“继续观看”“今日为你精选”等不同场景;截至 2024 年底,超过 3 亿用户产生了数千亿次交互。团队在推荐基础模型中把交互“tokenize(标记化)”:相邻行为可被压缩成更有意义的事件,但过度压缩会丢信号,过细又会让历史序列无法实时处理。它还明确指出,5 分钟预告片与 2 小时完整观看不应同权,因此尝试预测未来多个交互,而不只预测下一次点击,以减少短视。面对新内容冷启动,模型按内容“年龄”混合元数据与已有互动信号,并在训练中加入随机性,避免只会依赖热门历史。
Instagram:个性化模型的可靠性不只是接口没报错
当个性化扩展到很多场景后,系统必须知道每个模型服务什么业务、风险多高、基线和留出是什么,以及预测是否仍然可信。
Meta 工程团队披露,Instagram 的个性化不只覆盖 Feed、Stories 和 Reels,也用于评论展示、通知重要性和标签建议;检索、早排、晚排与大量实验叠加后,生产中超过 1,000 个模型。团队建立 model registry(模型注册表),记录模型用途、关键等级、baseline(基线)与 holdout(留出);再把监控、告警和自动发布接到这份统一记录。相关自动化把发布速度从每周少数几次提高到每周 10 次以上,并减少两天以上人工发布时间。更重要的是,他们认为请求成功率不足以代表推荐可靠:还要监控预测的 calibration(校准,即预测概率与真实发生率是否匹配)和归一化误差,任一关键预测异常,模型就被标记为不稳定。
先认识这次新增的机制
Elena Verna 是 Lovable 的增长负责人。我们已经拆过激活、使用留存、口碑、创新与优化;今天只新增访谈里的一个判断框架:Capability → Value → Scale(能力探索 → 价值形成 → 规模化)。它解释了为什么系统不能看到一次行为,就急着把它固化成长期画像。
核心机制:先判断用户在哪种学习状态
Elena 在访谈约 10:06–11:40 解释,新软件往往先经历 capability:用户探索“现在能做什么”;随后才进入 value:确认它怎样稳定解决问题;最后才可能 scale:扩展到更多工作与生活场景。她认为当时的 vibe coding 仍高度处于能力探索期,而且产品能力每一到三个月就明显变化,用户会反复回来查看边界。
这给个性化一个重要提醒:探索期的点击带有大量“试试看”。用户点过某个入口,可能只是好奇,不代表长期需要;今天没复用,也可能是能力尚未成熟,而不是偏好消失。过去常见做法是把一次行为写进用户画像,然后持续推荐相似内容。更好的做法是把“正在探索、已完成首次价值、已证明重复价值、任务已结束”分开,让系统对证据强度保持诚实。
AI 改变了哪一步
AI 可以联合行为路径与脱敏 VOC,判断一个动作更像探索、稳定价值还是失败重试;也可以随产品变化重新检查旧分群是否仍成立。它不只问“谁点了”,还问“点完完成了什么、后来是否在相同需求中复用、有哪些竞争解释”。
但这仍不能自动得到因果。Lovable 的高速 AI 创作场景与 Momcozy 的低频设备任务差异很大;“每一到三个月回来探索”不能成为母婴 APP 的留存标准。最值得借的是:把行为解释为会变化的证据,而不是永远有效的人格标签。Elena 在访谈末尾也明确希望外界 pressure-test(压力检验)她的思考,以区分真正模式和单个数据点——这恰好也是 Agent 应有的证据态度。
以“下一最佳动作 Agent”为例,完整链路不是“生成一段更像她的文案”,而是:
系统读取什么:经授权、最小化的任务资格、当前步骤、最近失败、稳定结果、APP 与设备版本、帮助是否已展示、脱敏 VOC、人工接管、历史实验和动作频控;同时读取数据缺失、事件版本、用户撤回授权与敏感数据禁用规则。
形成什么判断:先判断有没有资格行动,再区分探索、首次失败、已解决、结果未知和高风险;为“步骤内帮助、故障诊断、稍后重试、人工接管、不动作”估计预期价值与置信度,并列出反证。系统不能把孕产育阶段、健康或儿童信息当作默认营销特征。
能做什么:自动检查资格和频控,生成离线动作建议,在影子模式比较策略;只有事先批准、低风险、可回滚的产品内帮助才可进入小流量实验。未经明确授权,不发送 Push、EDM、站内信,不修改生产策略。
如何看结果并更新策略:不只看点击,还看首次稳定成功、问题解决、重复失败、人工接管质量、负面 VOC、投诉和合理周期价值;用对照判断增量。若点击上升而任务结果不变,系统降低该动作置信度;若“未知状态”经常被误判为失败,就先补测量,而不是增加提醒。
何时交给人:低置信度、全新错误、连续设备异常、健康或儿童语境、隐私投诉、多个目标冲突,以及所有真实上线与触达,都交给人。自动分群和写个性化文案只是 AI-assisted Operations(AI 辅助运营);持续感知情境、在受限动作集中选择、用增量结果更新策略,并保留不动作与人工接管,才开始接近 AI-native Growth System(AI 原生增长系统)。
场景一:设备绑定与首次稳定使用。 待验证假设是,“未完成绑定”至少混合未开始、权限失败、连接失败、已成功但结果丢失。可以借 Netflix 的信号分层:连续失败比一次页面浏览更接近求助需要,稳定连接比按钮完成权重更高;也可以借 Instagram 的注册表,为每个动作写清用途、资格、基线和回滚。不能用历史相似用户直接决定当前故障,也不能对结果未知者自动催促。最先需要的证据,是失败节点、帮助曝光、重试与稳定结果能否可靠串联。
场景二:AI 助手与 BBM/VOC。 待验证假设是,同一个问题在“低风险操作指导”和“涉及健康或儿童判断”中,下一步完全不同。系统可以根据任务类型、知识检索、工具结果和置信度选择回答、追问澄清或转人工;不能根据敏感对话建立长期营销画像,也不能把减少转人工当成默认优化目标。最先需要人工校准一小批“可以回答 / 必须追问 / 必须接管 / 不应个性化”的案例。
场景三:阶段性推荐。 待验证假设是,用户阶段变化会改变设备、内容或配件的相关性,但阶段推断错误的代价也很高。可以使用用户明确选择和当前任务作为证据,不能因一次浏览推断孕产育状态并持续触达。每项推荐都应有授权、频控、解释和不动作选项;最先验证的是“我们是否真的知道用户此刻有这个需求”,而不是推荐文案能否多拿点击。
- Contextual Personalization|情境化个性化:根据当前任务选择下一步,不是给人贴永久标签。Momcozy 例子:连续连接失败时展示对应诊断,而不是统一推送新手教程。
- Decision Policy|决策策略:把“什么情境下允许做什么”写成可执行规则或模型。Momcozy 例子:低风险且高置信时给步骤帮助,高风险时转人工,证据不足时不动作。
- Cold Start|冷启动:新用户、新设备或新功能没有足够历史,系统无法只靠过去行为判断。Momcozy 例子:首次使用新设备时先依靠设备类型与当前步骤,不假装已经了解长期偏好。
- Calibration|校准:系统说有 80% 把握的判断,长期看是否大约八成真的成立。Momcozy 例子:若“高概率需要帮助”经常对应已解决用户,就必须降级策略。
- No-action Option|不动作选项:系统可以判断当前最好的动作是不触达、不推荐。Momcozy 例子:结果未知或需求已结束时,先补证据或保持安静,而不是为了增长强行干预。
- 写清进入决策的资格:发生了什么才允许系统判断;
- 列四个候选:步骤内帮助、故障诊断、转人工、不动作;
- 每个候选各写一个必要证据、一个禁止条件;
- 写一个真实结果、两个护栏,以及“低于什么把握必须交给人”。
产出物是一页“情境—动作—证据—禁区—结果”卡。完成后能更新的判断是:我们是在做更聪明的消息分发,还是开始设计一个知道何时帮助、何时停手的决策系统?最后只回答一个具体问题:当系统只知道“绑定未完成”,却不知道用户卡在哪一步时,最合理的下一动作是什么——提醒、诊断、补测量,还是不动作?为什么?