博客
博客
记录我对 AI 产品、eval / benchmark 方法论与设计的思考。
-
FDE:把 AI 真正送进业务的人
AI 演示已经不难,难的是把它接进真实业务,并为上线后的结果负责。FDE 正在补上这段路:懂工程,也懂客户,还要把交付经验带回产品。
-
Agent 上线,比 Demo 难十倍
我用 Codex 很快做出了一个社媒 Agent Demo;真正准备上线时才发现,Agent 最难的不是展示能力,而是让系统持续验证、约束并为结果负责。
-
五种角色之外,PM 还要回答什么
AI 时代,PM 的价值不在职能清单里,而在两件事:在没有答案的地方做选择,在可以验证的地方把判断写成系统能继承的规则。
-
Loop Engineering 的本质:它把强化学习,搬到了推理期
上一篇是「人话版」,这篇是「困难模式」。我想论证一件事:Loop Engineering 本质上就是把强化学习搬到了推理期、还冻结了权重;一旦接受这个映射,循环的每个设计要点、每种翻车姿势,都能从 RL 里推出来。
-
会设计循环,是你下一个能力杠杆
写一句指令、看它出错、把报错贴回去、再试一次……二十分钟后我才反应过来:我哪是在用 AI,我是在给它当保姆。今年爆火的 Loop Engineering,说的就是怎么从这件事里脱身——以及,哪些活你压根不该这么交出去。
-
AI 能不能放手交给它,看你能不能检查它
我做大模型应用这些年一直在琢磨:AI Agent 到底能放手到什么地步?想到最后发现,决定这条线的不是模型多聪明,而是你能不能又快又稳地检查它干得对不对。