
Agent出错了,改提示词就能修复?丨Agent误解系列
Agent出错了,改提示词就能修复?丨Agent误解系列 Agent跑偏了,你本能反应是修改提示词,有时候确实奏效——改完再跑,问题消失了。于是这个动作就固定下来了:出错了,先改提示词。 但有一类出错,提示词改多少遍都没用。不是你没找到正确的表达方式,是问题根本不在那里。 NotebookLM的音视频概览,解读的比较通俗易懂,对于时间比较紧张的读者朋友,可以听听,会有启发。 ...

Agent出错了,改提示词就能修复?丨Agent误解系列 Agent跑偏了,你本能反应是修改提示词,有时候确实奏效——改完再跑,问题消失了。于是这个动作就固定下来了:出错了,先改提示词。 但有一类出错,提示词改多少遍都没用。不是你没找到正确的表达方式,是问题根本不在那里。 NotebookLM的音视频概览,解读的比较通俗易懂,对于时间比较紧张的读者朋友,可以听听,会有启发。 ...

用Agent,就只是把任务丢给它跑?丨Agent误解系列 你用Agent执行任务,最关注的是哪段时间? 大多数人的第一反应:执行时间。Agent在跑,我不用动。这个判断没错,但它只说对了一半——省掉的是执行时间,但最重要的那两段时间,大多数人根本没花在上面:启动前的任务设计,和结束后的结果验收。 结果是:Agent跑得很顺,方向是错的;跑完了,好不好也判断不了。 ...

提示词越详细,Agent跑得越好?丨Agent误解系列 提示词写得超详细,Agent还是跑偏了。 你的第一反应几乎是本能的:没说清楚,再加一段。于是你加了背景、加了示例、加了注意事项,改完之后提示词更详细。但是再跑一遍,Agent还是在关键地方出了偏差。 这时候你可能开始怀疑模型——它怎么就是不听? 真正的问题,不在提示词的信息量,在信息放的位置。 NotebookLM的音视频概览,解读的比较通俗易懂,对于时间比较紧张的读者朋友,可以听听,会有启发。 ...

Agent调用工具,跟你用工具是一回事?丨Agent误解系列 你给Agent配了十几个工具:发邮件、查日历、读文件、调接口。 配完之后,你可能有一种感觉——它现在"会用"这些工具了。就像你教会了一个助手怎么开软件、怎么找文件,接下来只管分配任务就好。 这个感觉很自然,但它在一个关键地方出了偏差。 你以为的"会用",是你理解的那种会用。Agent那边,发生的是另一件事。 ...

你是不是也认为,让Agent帮你做决定会更可靠丨Agent误解系列 让Agent帮你做决定会更可靠,这个想法有它合理的来源。 Agent给出的分析质量确实很高——它能快速整合大量信息、列出选项、梳理利弊、标注风险。在很多场景里,照着它说的做,结果也不差。你很自然地会觉得:这不就是在帮我做决定吗? 但这里有一个概念偷换,而且偷换得很隐蔽。 Agent在做的,是高质量的信息处理。它给你的,是"通常情况下大多数人会认为合理的选择"。这和"你这个人在你这个处境下的正确决定",是两件不同的事。 ...

Agent没有情绪,但它有偏见——只是很难看见丨Agent误解系列 因为Agent没有情绪,所以输出更客观,这个直觉有它合理的地方。 Agent确实没有情绪。它不会因为今天睡眠不足而判断失准,不会因为某个候选人和自己的老朋友长得像而打高分,不会因为下午三点精力下滑而在审阅第二十份简历时开始敷衍。 但"没有情绪偏见"和"没有偏见",是两件完全不同的事。 ...

不是你没说清楚,是这类任务天然不适合Agent丨Agent误解系列 用了Agent一段时间之后,很多人会形成一个固定动作:任务跑不好,回头改提示词。 这个逻辑有它成立的地方。提示词写得更清楚,Agent确实经常跑得更好。于是"描述清楚"慢慢成了一种万能解——Agent出问题,先检查自己有没有说清楚,再考虑别的。 但有一类失败,不管你怎么打磨描述都解决不了。不是你没说清楚,是这个任务的结构和Agent的工作方式本质上不匹配。你在优化输入,但问题出在任务本身。 ...

你是不是以为Agent越聪明,任务完成率就越高丨Agent误解系列 这个误解很正常,因为它有合理的来源。 模型能力确实在飞速提升——METR的研究数据显示,前沿AI Agent能稳定完成的任务时长每7个月翻一倍,到2026年初这个速度还在加快。厂商的宣传语也在强化这个感知:更强的推理、更长的上下文、更高的基准测试分数。你很自然地会认为,模型越强,任务就完成得越好。 ...

如何及早发现Agent的错误丨Agent可观测性设计 同样一个错误,发生在聊天里和发生在Agent执行链里,代价可以差十倍。 聊天里:AI说错了,你看到,发现不对,重新问一遍。代价是几分钟。 Agent执行链里:错误发生在第三步。第四步用了错误的输出继续跑,第五步基于第四步的结果调用了外部工具,第六步把处理结果写进了数据库,第七步触发了对外发送。你在最终结果里感受到有什么不对——但这时候,错误已经走了四步。 ...

为什么「让AI自己看着办」是一个危险的句式 有人给Agent下了一条指令:“这件事你自己看着办。” Agent看着办了。它做的每一步,单独拿出来都说得通。但最终结果,超出了那个人预期的范围——不是出了严重的错误,而是Agent在他以为"不需要碰"的地方,做了一个他以为自己会亲自做的决定。 那个人说:“我没让它这么做。” ...