企业第一次用 Agent,先选哪一段流程?
第一次做 Agent,最常见的失败不是技术问题,而是一开始就选错了流程:太大、太模糊、错了代价太高。这篇给出 4 个判断问题和一张打分表,帮你挑出最适合当“第一个试点”的那段工作。
很多团队第一次讨论 Agent,是从能力清单开始的:能不能读知识库、能不能操作系统、能不能发消息、能不能写报告。
聊着聊着,目标就变成了“做一个什么都能干的智能助手”。结果往往是:做了很久,演示的时候很惊艳,真正用起来却没人敢放心交出去。
我的建议正好相反:第一次,只选一段流程。 选对了,一两周就能看到结果;选错了,再强的模型也救不回来。
为什么“做一个全能助手”容易失败
全能助手的问题不在于做不出来,而在于没法验收。
- 它能做很多事,但每件事做到什么程度算“好”,没人说得清;
- 出了错,不知道是哪一步错的,也不知道该改哪里;
- 能力越多,需要开的权限越大,风险也越难控制。
一段具体的流程则完全不同:输入是什么、输出是什么、做对了长什么样,都能说清楚。能说清楚,才能验收;能验收,才敢交出去。
用 4 个问题判断一段流程
拿到一段候选的工作,依次问这 4 个问题:
1. 它够不够频繁?
每天或每周都要做的事,才值得花时间自动化。一年做一次的事,做得再好,节省的时间也有限。
2. 输入和输出固定吗?
输入是不是每次都差不多(一份会议记录、一张商品表格、一批客户邮件)?输出是不是有固定的格式(一份纪要、一张行动表、一篇详情页)?
格式越固定,越适合交给 AI。 每次都要临场发挥、依赖大量背景判断的事,先别碰。
3. 做错了,代价可控吗?
如果 AI 做错了,会发生什么?是多花五分钟改一改,还是会发错一封邮件给客户、改错一条线上数据?
第一个试点,最好选做错了也只影响内部、而且能在交出去之前被人发现的流程。对外的动作,比如发送、发布、付款,一律保留人工确认。
4. 能不能判断“做对了”?
有没有一个清楚的标准,让任何人都能检查结果对不对?比如“行动项数量和原文一致”“缺失的负责人写‘待确认’”“每个商品的尺寸参数和表格一致”。
如果连人都说不清什么叫做对,AI 就更做不对了。
一张打分表
把候选流程列出来,每个问题打 1 到 3 分:
| 候选流程 | 频繁 | 输入输出固定 | 错了可控 | 能判断对错 | 总分 |
|---|---|---|---|---|---|
| 会议记录 → 纪要和行动表 | 3 | 3 | 3 | 3 | 12 |
| 商品表格 → 详情页初稿 | 3 | 3 | 2 | 2 | 10 |
| 客户邮件 → 分类和回复草稿 | 3 | 2 | 2 | 2 | 9 |
| 自动回复所有客户咨询 | 3 | 1 | 1 | 1 | 6 |
| 制定下季度市场策略 | 1 | 1 | 2 | 1 | 5 |
总分最高、并且没有任何一项是 1 分的,就是你的第一个试点。
上面的分数只是示意。同样是“商品详情页”,有的团队商品参数很规整,可以打高分;有的团队每个商品都要大量主观判断,分数就低。打分一定要用你自己团队的真实情况。
选好之后,怎么开始试点
- 把现在的做法写下来:谁在做、多久做一次、用什么材料、交出什么。录一段屏幕也行。
- 收集 3 到 5 份真实样例:一份普通的,一份有缺漏的,一份容易出错的。
- 先写完成标准:每份样例“做对了”长什么样,开工前就定好。
- 只做这一段:不要顺手加功能,先把这一段跑通。
- 用样例验收:全部通过了,再交给团队在真实工作里用两周。
两周之后,你会得到比任何演示都有用的东西:一段真的在用的流程,以及团队对 AI 的真实感受。第二段流程要选什么,那时候会清楚得多。
几个常见的“看起来很适合,其实不适合”
- “让 AI 直接对外回复客户。” 频繁、看起来输入固定,但错了代价高,而且很难判断“回复得好不好”。可以先做成“生成回复草稿,由人确认后发送”。
- “让 AI 帮我们做决策。” 决策依赖大量背景和判断,没有标准答案。可以先让 AI 做“整理材料、列出选项和依据”这一段。
- “把整个部门的工作都接上 AI。” 这不是一个流程,是一个项目群。先挑其中一段。
如果你拿不准
选流程这一步,外部的人往往比内部更容易看清楚,因为不会被“我们一直都是这么做的”影响。
如果你手上有几段候选的工作,拿不准先做哪一段,可以把它们现在的做法发给我。我会帮你按这 4 个问题判断一遍,告诉你哪一段值得先做、哪一段暂时别碰。这也是我 Skill / Agent 定制服务的第一步。