同一条曲线上的两种速度:2.6 倍变成 8.3 倍
OpenAI 在 9 月 1 日发布的《AI 原生企业如何将工作流转化为运营能力》中,第一组数字与模型能力无关。前沿企业——每月 AI 使用量排在前 10% 的企业——每位活跃用户生成的输出词元,是一般企业的 8.3 倍;一般企业则指每月 AI 使用量排名居中的 10%,具体取第 45 至第 55 个百分位。今年 1 月,这个比值还是 2.6 倍。
图表给了同一批数据的另一种看法。横轴是 2025 年 4 月至 2026 年 6 月,纵轴以 2025 年 4 月的一般企业为 1.0。图上标注:前沿企业 17.1x,一般企业 2.1 倍。
词元不是收入,也不是质量分。它衡量的是有多少工作被真正交给了模型去执行。所以这组数字说的是使用深度在分化,而不是谁赚得更多。
数据来自 OpenAI 自己企业客户的脱敏汇总。消息内容由自动化系统分类,OpenAI 表示没有员工查看过客户消息。样本企业数量、行业构成、统计周期都没有公布,也没有第三方复现。能确定的是:同一种工具、同一段时间,不同组织的用法已经不在一个量级。
同一条曲线上的两种速度
怎么读:两行同属图表纵轴口径:横轴为 2025 年 4 月至 2026 年 6 月,纵轴以 2025 年 4 月一般企业为 1.0;样本企业数、行业构成与计算方法未公布。
那么,这三家把差距拉开的公司到底做了什么不同的事?
差距不在提问次数,在有没有把流程固化成资产
三家公司做的事情有一个共同形状:把一件重复发生的工作写成智能体可以反复执行、并且带审核关卡的流程,而不是把 AI 当成随时待命的问答窗口。Basis 把员工入职写成一项技能。Clay 为每个客户建一个持久工作空间,用子智能体持续更新。Exa 把“从发现机会到实施”的步骤写成一套 Codex 工作流。
OpenAI《企业信号》对超过 1000 万条消息的分析给出了同一个方向:企业级 AI 正从“辅助员工产出”转向“帮助团队执行工作”。在这批消息里,编程以及系统或智能体操作合计占了智能体消息的近 75%。截至 6 月,企业客户使用 Codex 和 ChatGPT 生成的输出词元中,Codex 占 64%。
行为差异还有一个可量化的侧面。前沿企业每周有 21% 的活跃用户使用插件、19% 使用技能;一般企业这两个数字分别是 9% 和 3%。插件与技能属于把方法固定下来的动作,和提问次数不是一回事。
差别就在这里:流程被写下来之后,每次遇到例外都会变成下一次运行的输入,产出随运行次数累积。停留在“让每个人自己问 AI”的组织,每次都要从头交代背景,产出只能随人数增长。插件和技能的定义、统计周期与样本口径都没有公布,这只能算一条官方给出的线索,还不是因果证明。
把方法固定下来的人,比例差了不止一倍
| 能力(每周活跃用户中的使用比例) | 前沿企业(前 10%) | 一般企业(第 45 至第 55 百分位) |
|---|---|---|
| 使用插件的用户 | 21% | 9% |
| 使用技能的用户 | 19% | 3% |
用图表查看这组数据
把流程“写下来”具体长什么样?Basis 的入职流程最容易看懂。
Basis:演示一次,然后把入职写成智能体能照做的说明书
Basis 为会计师事务所开发 AI 智能体。它的首日入职流程是这样的:新员工第一天就能用 Codex 加上一项公司专属入职技能,里面写清触发条件、已知步骤、能用到哪些工具,以及什么算“完成”。Codex 负责欢迎新员工、讲清公司关键概念,并在这台机器上把该做的集成设置做完。
据 Basis 称,首日入职流程从两小时缩短到 30 分钟,人力团队因此能把更多时间放在文化与支持上。更关键的改动发生在流程之外:遇到反复出现的问题或例外,人力团队会在下一批员工入职前更新这项技能。入职不再取决于某个人当天是否到场,完成标准写在技能里,例外留给人处理。
两小时到 30 分钟是公司自述、经 OpenAI 转述,没有给出样本量、测量方法和统计周期,也不能推出其他公司的入职会同样缩短。这个案例立得住的部分是流程形态:一项工作被演示一次之后,可以变成不依赖具体某人的执行资产。
Basis 把入职流程做成可更新技能
入职流程长期对雇主和员工都繁琐;Basis 为会计师事务所开发 AI 智能体。
- 首日执行
员工第一天使用 Codex 和一项公司专属入职技能;Codex 欢迎新员工、介绍关键概念,并在后台完成集成设置。
入职第一天,员工即可使用 Codex 和一项公司专属的入职技能
- 例外回流
遇到反复出现的问题或例外情况时,人力团队在下一批员工入职前更新这项技能。
遇到反复出现的问题或例外情况时,人力资源团队可在下一批员工入职前更新这项技能
- 技能化
Basis 演示一次入职流程,随后将其转化为含触发条件、已知步骤、工具访问权限和完成定义的复用技能。
Basis 只需演示一次入职流程,随后便将其转化为一项可复用的技能
结果:Basis 称首日入职流程从两小时缩短至 30 分钟,流程更一致、可重复且更易改进。
不能据此证明:样本量、测量方法、基线与统计周期未公布;案例由 OpenAI 转述,不能推出其他公司的入职会同样缩短。
基于证据重建事件顺序,非逐字对话
入职的输入相对稳定。销售场景每天都在变,需要的设计完全不同。
工作每天都在变:Clay 靠节奏维持情境,Exa 靠关卡控制发布
Clay 面向市场进入团队做营收引擎,它面对的难题是情境分散:交易的关键信息散落在 CRM 记录、电子邮件、Slack、通话、演示文稿、短信,以及和内部团队、客户的对话里。一名 GTM 工程师的做法是给每个客户建一个持久工作空间,配一个专属子智能体。子智能体夜里读一手资料、更新交易文件夹;早上,一个协调智能体把这位销售所有客户的更新汇总成一份简短的优先行动清单——回答客户还没有被回答的问题、补齐采购委员会里缺的角色,或者给潜在客户一个重新接洽的理由。据 Clay 称,这套流程每晚省下大约一小时的收件箱整理时间,每条建议都附有佐证,销售可以先核对一手资料再行动。
Exa Labs 为 AI 智能体做网络搜索基础设施,希望开发者在任何需要的地方都能用上它的搜索 API。它把“发现机会、收集情境、跨系统协调”这条原本靠人跑的路径改写成一套专为 Codex 定义的工作流:明确优先级、开放必要资料、所有内容在发布前必须通过人工审核。Codex 负责监控高优先级集成机会、创建拉取请求、运行测试,用 Slack 和 Notion 的信息准备每周更新,必要时起草初版公告供团队审核。
两家公司解决的是不同问题,用的是两种办法。Clay 靠结构与节奏,每个客户一个空间、每晚一次更新;Exa 靠关卡,测试与审核决定什么能出街。相同点是:智能体可以在没人盯守时往前推进,但推进的边界由可核查的证据和人划定。Exa 明确保留了三件事给人的判断——哪些机会值得做、公司对外承诺什么、外部关系怎么管。这些效果数字没有独立复现,Exa 也没有给出任何量化结果。
Clay 的一天:夜里更新,早上汇总
- 1子智能体更新交易文件夹
子智能体审阅一手资料,更新每个客户的交易文件夹
- 2协调智能体汇总
把该销售名下所有客户的更新合成一份简短的优先行动清单
- 3核查佐证
每条建议附有相关佐证,销售在行动前核查一手资料
- 4落实细小动作
回答未解决问题、补齐采购委员会角色,或为潜在客户提供重新接洽的理由
Clay 为每个客户建持久工作空间
交易关键情境分散在 CRM 记录、电子邮件、Slack、通话、演示文稿、短信,以及与内部团队和客户的对话中。
- 搭结构
一名 GTM 工程师为每个客户建立持久工作空间,并配备专属子智能体。
为每个客户建立一个持久工作空间,并配备专属子智能体
- 夜间更新
子智能体审阅一手资料,在夜间更新对应的交易文件夹。
每个子智能体都会审阅一手资料,并在夜间更新对应的交易文件夹
- 早晨汇总
协调智能体每天早上汇总所有客户的更新,生成简短的优先行动清单。
每天早上,一个协调智能体会汇总她所有客户的更新,生成一份简短的优先行动清单
- 证据核查
每项建议附有佐证,销售在行动前可核查一手资料,并可在客户权限范围内扩大共享情境。
结果:据 Clay 称,该工作流每晚节省约一小时收件箱整理时间,每日优先事项帮助落实细小行动。
不能据此证明:公司自述且为单人口径,未给测量方法、样本与时间范围;不能证明其他团队同样收益或带来商业结果。
基于证据重建事件顺序,非逐字对话
Exa 把集成机会变成经过测试与审核的成果
Exa Labs 为 AI 智能体构建网络搜索基础设施,希望开发者在任何需要的地方都能使用其搜索 API。过去开发者关系与客户团队需要监控代码仓库及生态、识别集成机会、收集情境并跨系统协调。
- 定义工作流
Exa 将步骤转化为专为 Codex 定义的工作流,包含明确优先事项、必要资料访问权限,并要求所有内容在发布前经过人工审核。
Exa 将这些步骤转化为一套专为 Codex 定义的工作流
- Codex 执行
Codex 监控高优先级集成机会、收集情境、创建拉取请求、运行测试,并利用 Slack 和 Notion 等来源准备每周更新,必要时起草初版公告。
Codex 会监控高优先级的集成机会、收集相关情境、创建拉取请求、运行测试
- 保留判断
哪些机会值得把握、Exa 应做出哪些承诺、如何管理外部关系,仍由人决定。
哪些机会值得把握、Exa 应做出哪些承诺,以及如何管理外部关系,仍由人来决定
结果:工作流把机会从信号转化为经过测试的成果,减少了研究、工程与沟通之间的交接。
不能据此证明:没有量化效果、集成机会数量、测试通过率或 API 采用增长;案例由 OpenAI 转述,不能证明商业成功。
基于证据重建事件顺序,非逐字对话
这带出一个更实际的问题:什么该交出去,什么必须留下?
审核关卡不是保守,它决定流程还能不能变好
三家公司交出去的是执行,留下的是判断。Basis 把例外留给人力团队,Clay 让每条建议附上佐证、由销售核实后再行动,Exa 把机会取舍与对外承诺留给人。这看起来像保守,其实是让工作流持续变好的前提:测试和审核节点让智能体的工作可见,出错的地方才会变成下一次运行前要修改的环节。如果一开始就允许跳过审核,例外就没有回流渠道,流程也就丢掉了改进信号。
不过这只有定性描述,目前没有任何对照数据能说明“加审核”比“不加审核”更快,只能说清楚不加审核时改进信号会丢失。另一个规律来自 Exa 的实践:工作越重要,权限、证据和决策权在流程设计里占的比重就越高。这是三家案例呈现出来的做法,不是一条通用规则。
执行交给智能体,判断留给人
| 公司 | 智能体负责 | 人负责 |
|---|---|---|
| Basis(员工入职) | 按技能里的触发条件与步骤执行:欢迎新员工、讲解关键概念、后台完成集成设置 | 处理例外与反复出现的问题,并在下一批入职前更新技能 |
| Clay(客户情境) | 子智能体夜间更新交易文件夹,协调智能体早上汇总出优先行动清单 | 核查每条建议的佐证、决定采取什么行动,并在客户权限范围内共享情境 |
| Exa(开发者集成) | 监控集成机会、收集情境、创建拉取请求、运行测试、准备每周更新并起草公告初稿 | 决定哪些机会值得把握、公司做出什么承诺、如何管理外部关系 |
既然审核是必要的,一个还没开始的组织该从哪一步下手?
OpenAI 给的六步顺序,以及两个容易漏掉的细节
OpenAI 把上面的经验整理成六个步骤。切入点要选一件足够频繁、也足够重要、值得重新设计的端到端工作流;接着明确预期成果和衡量方式,并把“应用深度”与“价值”分开跟踪——已完成任务、接入的情境与工具、例外数量、审核工作量属于前者,周期时长、质量、成本、收入和风险属于后者。输出量增加只说明人们让 AI 承担了更多工作,工作流成果才说明这些工作是否真的重要。
第三步是把智能体当成需要工作说明的同事:写清触发条件、预期成果、需要的资料与工具权限、它可以推进到什么程度、必须提供哪些证据、在哪些环节必须停下来接受人工审核。第四步是围绕它安排人,让最熟悉这项工作的人参与设计,并明确业务成果、领域逻辑、访问控制、推广采用和日常使用分别由谁负责;团队小的时候几个人可以一起扛,流程变大之后就必须明确决策权。
最容易漏掉的是第五步:让实验可见、成果可复用。用插件、技能或共享工作空间把验证过的流程封起来,下一次实验就从更好的起点开始。工具分工上,聊天适合提问和快速协作,ChatGPT 工作适合多步骤知识工作与完整交付,Codex 适合技术执行。OpenAI 的研究还提到一个细节:采用 AI 六个月后,职业生涯早期的员工每周发送的消息比高管多 13 条,这项研究的样本与方法没有公布,但它指向的趋势是实验热情先在资历较浅的人身上出现。Codex 的每周活跃用户也在从工程扩散到别的职能:自 2 月以来,法务领域增至 108 倍,销售和招聘各 41 倍,营销 26 倍,工程 5 倍;基期基数没有公布,倍数高不代表人数多。
OpenAI 给出的六步顺序
选一个值得重做的流程
从端到端工作流入手,确保它覆盖战略重点、系统、交接、控制措施和可衡量的关键成果;要足够频繁以便从中学习,也要足够重要值得重新设计。
定衡量方式
明确负责人、关键绩效指标、基准和护栏;应用深度看已完成任务、接入的情境与工具、例外与审核工作量,价值看周期时长、质量、成本、收入或风险。
写智能体的工作说明
写清触发条件、预期成果、所需情境、工具与权限、可以推进到什么程度、必须提供哪些证据、在哪些环节必须停下接受人工审核。
安排人围绕它协作
让最熟悉工作流的人参与设计,明确业务成果、领域逻辑、访问与控制、推广采用和日常使用各由谁负责。
让实验可见、成果可复用
给员工测试空间,把有效实践背后的流程和证据封装成技能、插件或共享工作空间。
把有效模式搬到下一个切入点
保留已验证的情境、权限、评估、审核节点、负责人、衡量指标和赋能措施,让下一次实验从更好的起点开始。
步骤顺序来自 OpenAI 的整理,六段宽度等分,不表示耗时或重要性差异。
判断一家公司有没有真在用智能体,看它有没有写下来
回到最初那组数字。8.3 倍与 2.6 倍之间隔着的东西,更接近流程被封装的程度,而不是模型的代差:三家公司的起点都很小——一次入职、一个客户文件夹、一条 API 推广路径——但它们把演示变成了资产,把例外变成了下一次运行的输入。
这个判断有明确的改变条件。如果出现独立数据显示,使用深度高的组织并没有在周期、质量、成本或风险上同步改善,“封装带来复利”就只是一种对使用量的解释,而不是对经营结果的解释。更强的结论目前也没有依据:Exa 没有给出量化效果,Basis 和 Clay 的数字都来自自述,OpenAI 自己的样本口径始终没有公开。
所以判断一家公司是不是真的在用智能体做事,看一个细节就够了:它有没有把某件事的步骤、完成定义和例外处理写下来。写下来了,这件事就不再依赖某个人当天是否在场;没写下来,AI 再强也只是一个随叫随到的帮手。



