📌 TL;DR: 试点通过选择业务对象、隔离部分依赖和提供集中支持,帮助企业验证一项价值能不能发生。试点中的客户、订单和经营结果都可以是真实的,但这些证据具有条件边界,不能直接外推到公司的正常运行。 受控业务试运行需要把正式运行涉及的业务范围、资源和组织关系重新接入同一个环境,同时通过时间、流量、区域或行动类型限制Agent实际接管。业务条件完整,不等于AI一次性全面接管;受控的是Agent承担业务的程度,而不是继续把业务现实隔离在外。 AI Agency还会增加一种特殊问题。它采取行动以后,业务状态、Human行为和共享资源随之改变,这些变化再成为反馈,影响后续行动。企业需要观察的因此不只是单次功能和结果,而是一段持续形成的业务轨迹。 **试点证明价值可以发生,业务试运行证明这项价值能否进入企业常态。** 当试运行提供了足以覆盖主要业务关系和跨期影响的证据,企业才开始有依据把Agency从项目能力转变为正常经营能力。

AI Agency试点已经证明价值,为什么还不能直接进入正式运行?丨ANC重新理解AI原生试运行

那家全渠道零售企业的库存与履约 Agent,已经完成了一个季度的试点。试点范围内,Agent 不只运行稳定,也确实改善了客户和经营结果:重点商品的订单满足率有所提高,一部分紧急调拨和加急履约得到减少。项目团队已经能够说明,Agent 采取了哪些行动,以及这些行动怎样带来了经营结果的变化。

验收会上,管理层开始讨论让 Agent 进入正式运行。既然它已经在真实订单、真实库存和真实客户中证明了价值,下一步似乎就是由业务部门正式接手,再逐步扩大到更多门店和商品。

02页_f.png

业务负责人没有否定试点结果,但也没有同意直接进入正式运行。在他看来,试点已经证明 Agent 能够在当前范围和支持条件下创造价值;当它进入正常业务,与更多门店、区域、资源和 Human 流程共同运行以后,原来的经营改善能否保持,仍然需要验证。

AI Agency试点已经证明价值,为什么还不能直接进入正式运行?

NotebookLM的音视频概览,解读的比较通俗易懂,对于时间比较紧张的读者朋友,可以听听,会有启发。


一|试点证明价值可以发生,但还不是正式运行的依据

试点的作用,是帮助企业用可控投入验证一项价值假设。企业选择适合观察的业务对象,暂时把一部分复杂关系留在范围之外,并提供集中的项目支持,以确认 Agent 是否真的能够改变客户或经营结果。如果试点范围内的价值都没有出现,企业也就没有必要继续讨论正式运行。

03页_f.png

这些安排并不意味着试点结果不真实。Agent 采取了真实行动,客户和经营结果也确实发生了变化。只是这些证据存在明确的条件边界:它们证明的是 Agent 在当前业务范围和支持方式下取得的结果。

进入正常业务以后,其中一些条件可能不再存在。试点可以选择数据较完整、规则较清楚的业务对象,项目团队能够集中处理系统问题,业务专家也能及时发现和修正异常。较短的观察周期,还可能来不及暴露资源长期占用、支持成本累积以及不同业务之间的相互影响。

因此,试点可以证明这项价值能够发生,却不能直接证明,当业务范围扩大、原来被隔离的关系重新出现、项目支持回到正常强度以后,同样的经营改善仍然能够保持。

这并不是 AI Agency 独有的问题。任何复杂系统从局部试点进入正式业务,都需要进一步验证实际负载、上下游依赖、异常处理、组织执行和恢复能力。试点成功说明项目值得继续验证,但正式运行还需要更完整的业务证据。

这就是为什么试点与正式运行之间,还需要一个业务试运行阶段。


二|业务试运行怎样补足试点没有覆盖的条件

为了看清这个阶段承担的任务,可以先区分试点、受控业务试运行和常态化运行。它们不是一套固定的实施步骤,而是三种不同的证据状态。

04页_f.png

试点回答的是:在经过选择的业务范围和较集中的支持条件下,这项 Agency 能不能创造价值。企业可以暂时隔离部分依赖,提供临时保障,并保持较短周期和较强可逆性,以便先确认价值是否可能发生。

受控业务试运行需要继续回答:当正式运行会涉及的业务对象、上下游流程、共享资源和组织关系重新进入同一个环境以后,试点中的经营改善还能不能保持。企业不仅要增加门店、商品或业务量,还要让 Agent 面对正常业务中实际存在的情境差异、资源约束、协作关系、成本和风险。

让这些业务条件进入试运行,不等于让 Agent 立即接管全部业务。企业可以开放正式运行所需的业务关系,同时只允许 Agent 在部分时段、部分流量、指定区域或者特定行动类型中作出决定,并保留干预、回退和止损能力。

业务条件完整,Agent接管范围受控。

这里的“完整”,不是要求一次试运行穷尽未来可能发生的所有情况,而是不能继续把正式运行所依赖的重要业务关系隔离在外。这里的“受控”,则是限制 Agent 实际承担业务的范围,使企业能够在风险可控的情况下,观察它进入正常业务以后会发生什么。

05页_f.png

当业务试运行覆盖了足以暴露主要资源冲突、跨期影响和组织依赖的周期,并表明原来的经营改善不再依赖临时项目机制时,企业才开始有依据让 Agency 进入常态化运行。

试点证明价值可以发生,业务试运行证明这项价值能否进入企业常态。


三|完整业务条件接回以后,库存Agent出现了什么新问题

这家零售企业的试点只覆盖部分核心门店和重点商品。企业选择了数据质量较好、经营规则相对清楚的对象,区域运营专家持续关注 Agent 的行动,项目团队也能够迅速处理数据、接口和工具问题。部分调拨与履约资源还得到了提前保障,因此试点中的资源竞争相对有限。

这些条件帮助企业看清 Agent 能否改善订单履约,却没有覆盖它未来需要面对的全部业务关系。进入受控业务试运行以后,企业把更多门店、商品、区域库存和共享履约资源接入同一个环境,同时只允许 Agent 在指定区域和部分时段采取行动。

06页_f.png

一个区域的重点商品出现缺货风险以后,Agent 决定从另一区域调拨库存。在试点中,这类行动曾经有效;但这一次,另一区域已经安排了促销,Human 运营团队也按照原有流程提交了补货计划。Agent 的调拨改善了当前区域的订单满足,却提高了另一区域的缺货风险,也占用了其他业务正在等待的物流资源。

事情没有停留在这一次调拨上。调拨完成以后,区域库存、待执行补货、物流资源占用和新的订单变化共同构成了下一轮业务状态。Agent 可能根据这些变化继续调整库存优先级,Human 团队也可能重新安排促销和补货,两套行动由此开始互相影响。

试点中的 Agent 并没有突然失效,它的判断能力也未必下降。真正发生变化的是它所处的业务环境:原来被暂时隔离的区域关系、Human 行动和资源竞争重新出现,使同一种行动产生了不同的后续影响。

所以,试点中的经营改善依然真实,却不足以单独证明它能在完整业务系统中保持。业务试运行的价值,就在于让这些相互作用重新出现,再受控观察原来的经营结果会发生什么变化。


四|Agency给业务试运行增加了什么新挑战

传统系统同样需要在业务试运行中验证实际负载、跨系统依赖、异常处理和组织执行。即使没有 AI,一项功能在有限试点中运行良好,也不代表它进入更广泛的业务以后,不会遇到新的约束和冲突。

07页_f.png

AI Agency 在这些通用问题之外,还要求企业多观察一件事。因为它不是反复执行一组已经确定的动作,而会根据当时的业务状态和此前行动造成的结果,持续形成下一步。

完整业务状态 → Agency形成下一步并采取行动 → 共享资源、Human行为和其他系统状态改变 → 这些变化成为新的业务反馈 → Agency据此再次形成下一步

这段关系与一次普通的“输入—处理—输出”不同。Agent 采取行动以后,下一次判断面对的已经不是原来的业务:资源分布发生了变化,Human 和其他系统可能作出响应,客户行为也可能随之改变。这些新的状态进入判断以后,又会产生新的行动。

因此,即使每一次行动单独看都有合理依据,连续形成的行动仍然可能走出另一条轨迹。局部偏差可能在后续反馈中得到纠正,也可能被一次次合理行动持续放大。企业只有观察一段真实运行过程,才能知道最终出现的是哪一种结果。

08页_f.png

Agency 的业务试运行不能只检查系统是否稳定,也不能只是把试点指标换到更大样本中重新计算。企业还需要看清:Agent 的行动怎样改变业务,这些变化怎样影响后续判断,以及连续行动最终是在推进经营目标,还是逐渐把业务带向另一个方向。

这才是 Agency 给业务试运行增加的新问题。企业要验证的,不只是一个 Agent 能不能工作,而是一个能够持续形成下一步的新运行主体,会把业务持续推向哪里。


五|进入正式运行以前,管理层需要得到什么证据

面对一个已经成功的试点,管理层首先需要看清,原来的经营改善依赖了哪些条件。Agent 本身发挥了什么作用,经过选择的业务对象、临时资源和集中支持又发挥了什么作用;当这些条件回到正常状态以后,原来的结果是否还能保持。

管理层还需要观察 Agent 与其他业务共同运行时发生了什么。它的行动是否与 Human 或其他系统相互冲突,局部改善是否把风险和损失转移到其他业务,共享资源的竞争是否改变了原来的价值关系。这些影响无法从孤立试点中推断,只有相关业务真正进入同一个环境以后才可能被看见。

业务试运行还需要覆盖足以暴露主要跨期影响的周期。它不能在结束时完整证明未来的长期价值,却应该让企业看见:随着临时支持减弱、运行周期拉长,客户和经营结果是否仍然改善,成本、风险和组织负担是否开始抵消这项价值。Agency 进入常态化运行以后,这些判断仍然需要被持续更新。

09页_f.png

如果证据还不充分,企业得到的也不一定是永久停止的结论。它可能需要继续观察,调整 Agent 运行所依赖的业务条件,或者暂时不扩大其职责。

本期回答的,是管理层在作出正式运行决定以前至少需要看到什么,而不是提前决定哪些 Agency 永远不应该建设。

试点成功不是正式运行的依据,而是业务试运行的起点。


ANC视角:从试点能力到正常经营能力

AI Agency 进入企业正常运行,不只是把一项已经通过测试的技术能力交给更多用户,而是让一个新的运行主体开始持续承担经营职责。试点可以证明它有能力创造价值,但企业还需要知道,当它真正与公司的其他业务共同运行以后,这项价值是否仍然存在。

10页_f.png

因此,从试点到常态化运行并不只是一次技术交付。企业是在决定,是否可以把一段持续推进经营目标的职责交给 Agency。业务试运行提供的,正是作出这项经营决定以前所需要的现实证据。


写在最后

上一期回答的是:Agent 的系统表现是否已经通过真实行动改变了客户和经营结果。这一期从已经出现的经营改善继续向前,追问当业务条件发生变化以后,这些结果还能不能保持。

业务试运行可以为常态化运行提供更完整的现实依据,却不能消除未来的不确定性。Agency 进入常态以后,企业仍然需要持续观察经营结果、成本和风险,并判断原来的结论是否因为业务变化而失效。

即使一项 Agency 已经证明自己能够进入企业常态,另一个问题仍然没有回答:

公司是否应该继续扩大AI承担的业务范围?


来源与限制

  1. NIST AI Risk Management Framework Core提出,AI 系统的表现应在与部署情境相似的条件下验证,对超出原有开发或测试条件的可推广性限制需要记录,并应在系统运行期间持续监测。本文只用它支持“AI 系统验证具有部署情境边界”这一外部事实,不将 NIST 的风险管理框架等同于 ANC 的业务试运行判断。
  2. Perdomo 等人的《Performative Prediction》讨论了预测参与决策以后如何影响其试图预测的结果;Brown 等人的《Performative Prediction in a Stateful World》进一步讨论了模型、行动与持续变化状态之间的关系。两项研究只支持“AI 支持的行动可能改变未来状态和反馈”这一有限事实,不直接研究企业 AI Agency,也不承担本文的经营价值结论。
  3. 英国政府的《Artificial Intelligence Playbook for the UK Government》记录了 GOV.UK Chat 在早期受控测试中使用专家和内容设计人员进行评估,同时指出第一阶段高度人工化的质量保障方式不适合直接扩大。该案例只说明试点中的人工支持未必能够按相同强度延续,不与库存及履约 Agent 作直接类比。
  4. 文中的全渠道零售企业、库存与履约 Agent、区域调拨及 Human 运营冲突均为延续本系列的设想案例,不对应具体公司,也不用于证明所有库存 Agency 都会出现相同结果。
  5. “试点证明价值可以发生,业务试运行证明价值能否进入企业常态”“业务条件完整、Agent 接管受控”,以及 Agency 的业务试运行需要观察持续行动轨迹,均为 ANC 在本文提出的企业建设判断。本文不提供灰度发布方案、实验设计、生产架构、ROI 模型或 Agency 停止决策框架。

感谢你看到最后,如果你觉得有启发,随手点个赞、在看、转发吧,如果想第一时间收到推送,也可以给我加个星标⭐我们下期见。

我是「AioGeoLab」主理人塔迪Tardi,AioGeoLab是深度洞察AI第一性原理和应用实践的前瞻性研究实验室,目前有两个主要研究方向:
塔迪AI工程系列」FDE落地工程、ANC:AI Native Company未来公司系列、GEO、AI判断工程。
塔迪硅基禅心」是传统东方智慧、未来AI前沿、当下应用实践,深层共鸣的探索。不是用AI解读经典,也不是用经典指导AI。 这是一场跨越2500年的对话,在算法与古老智慧之间,照见意识、智能与存在的本质。
塔迪的微信 - tardyai2025