博客
博客
记录我对 AI 产品、eval / benchmark 方法论与设计的思考。
-
借来的眼睛
给 DeepSeek 装上「看设计稿」的眼睛,只花了一小部分时间;剩下的时间都在回答一个问题——借来的这只眼,够不够格当裁判。以及三次我以为自己验证了什么、其实什么都没验的经历。
-
体感是真的,归因往往是错的
DeepSeek Harness 开源第三天,我去给它写第一个插件。吸引我的是「一切皆插件」——自我进化的前提,是 agent 得先有一个可以被改动的自己。而那天我说冷启动要四十秒的时候,那是真实体感;量了三次,三秒。多出来的三十七秒,是我自己等待的开销。
-
FDE:把 AI 真正送进业务的人
AI 演示已经不难,难的是把它接进真实业务,并为上线后的结果负责。FDE 正在补上这段路:懂工程,也懂客户,还要把交付经验带回产品。
-
Agent 上线,比 Demo 难十倍
我用 Codex 很快做出了一个社媒 Agent Demo;真正准备上线时才发现,Agent 最难的不是展示能力,而是让系统持续验证、约束并为结果负责。
-
五种角色之外,PM 还要回答什么
AI 时代,PM 的价值不在职能清单里,而在两件事:在没有答案的地方做选择,在可以验证的地方把判断写成系统能继承的规则。
-
Loop Engineering 的本质:它把强化学习,搬到了推理期
上一篇是「人话版」,这篇是「困难模式」。我想论证一件事:Loop Engineering 本质上就是把强化学习搬到了推理期、还冻结了权重;一旦接受这个映射,循环的每个设计要点、每种翻车姿势,都能从 RL 里推出来。