博客
博客
记录我对 AI 产品、eval / benchmark 方法论与设计的思考。
-
Loop Engineering 的本质:它把强化学习,搬到了推理期
上一篇是「人话版」,这篇是「困难模式」。我想论证一件事:Loop Engineering 本质上就是把强化学习搬到了推理期、还冻结了权重;一旦接受这个映射,循环的每个设计要点、每种翻车姿势,都能从 RL 里推出来。
-
会设计循环,是你下一个能力杠杆
写一句指令、看它出错、把报错贴回去、再试一次……二十分钟后我才反应过来:我哪是在用 AI,我是在给它当保姆。今年爆火的 Loop Engineering,说的就是怎么从这件事里脱身——以及,哪些活你压根不该这么交出去。
-
AI 能不能放手交给它,看你能不能检查它
我做大模型应用这些年一直在琢磨:AI Agent 到底能放手到什么地步?想到最后发现,决定这条线的不是模型多聪明,而是你能不能又快又稳地检查它干得对不对。
-
AI native 的人,是什么样的人
从 2023 年开始做大模型应用,我越来越确信:最快适应 AI 的人,往往不是技术最强的人。每一代「原生的人」,差别不在工具,而在默认假设。
-
Agent 时代的界面为什么反着做
一个九岁孩子用 Claude Code 做出了一款精美的游戏。模型已经够聪明——真正的问题是:什么样的交互,能让一张"有心力的白纸"也驾驭得了这份聪明?
-
AI 时代的 PM 到底在做什么
PRD 已死,benchmark 永生。AI 时代,PM 的价值载体正在迁移:从写需求文档,到定义模型行为标准。