青蛙小白

企业 AI 原生转型

企业 AI 原生转型 是本库用于组织企业案例的归纳视角,不是 OpenAI 或 Deutsche Telekom(德国电信)定义的标准框架。它描述企业从“让员工使用 AI 工具”继续走向“重新设计流程、责任、客户触点与运营控制”的过程。核心判据不是部署了多少席位,而是工作本身是否改变,以及这种改变能否由业务结果与风险指标共同验证。

四层推进

德国电信与 NTT DATA Group 的案例可以整理成四个逐层深入、但不必严格串行的层次:

flowchart LR
    A[员工获得 AI 工具] --> B[广泛实验与需求发现]
    B --> C[重构具体业务流程]
    C --> D[嵌入客户触点与核心运营]
    D --> E[用业务结果与风险指标治理]
    E -.反馈.-> C
  1. 工具可达:让员工较早接触通用 AI,积累使用经验并形成内部需求。
  2. 实验扩散:允许自下而上的探索,同时由管理层明确优先级和负责人。
  3. 流程重构:从高频、摩擦大的流程切入,重新安排上下文、自动化、人类接管和质量检查,而非只给旧流程加助手。
  4. 运营内生:把 AI 放进客户已有渠道和核心运营,例如客服、电话网络与网络资源调度,并持续治理数据、权限、安全和效果。

德国电信案例中的实践覆盖四类场景:向员工提供 ChatGPT Enterprise;在客户服务中探索减少等待与人工转接;把实时翻译、通话助手和通话后摘要带入用户已有的电话渠道;以及根据通勤、赛事等需求变化动态调整移动网络资源。来源没有披露后三类场景的具体模型、控制闭环或生产指标,因此这些内容更适合作为转型方向,而不是已验证的产品成效。

NTT DATA 则展示了另一条推进路径:先用全公司 ChatGPT Enterprise 培养研究、写作和内容创作习惯,再把约 9,000 名员工引向可执行明确任务的 Codex。公司内部 CoE 负责许可证、技术验证、活动、用例开发、使用监测、知识资源与安全指南;“Client Zero”机制让企业先在自己内部试用,再把局部成果整理成可复用实践。这条路径可以概括为:

flowchart LR
    A[广泛部署 ChatGPT Enterprise] --> B[形成日常 AI 使用习惯]
    B --> C[用 Codex 执行边界清楚的任务]
    C --> D[CoE 验证效果与风险]
    D --> E[指南、培训与 Skill 复用]
    E -.新用例与反馈.-> C

员工驱动的构建者:Univé

荷兰合作保险机构 Univé 提供了第三条路径,其核心主张由数据与 AI 负责人 Yous van Halder 点出:“多数组织靠构建更多解决方案来扩展 AI;我们靠造就更多构建者来扩展 AI。”这条路径不把 AI 当 IT 项目,而是当作组织能力转型:管理层先集体接受 AI 领导力训练,把治理从部署第一天就设计进来,再给员工许可、时间与结构去重新设计自己的工作。

Univé 的治理主张值得单独拎出来:它把治理当作加速器而非守门人。Enterprise 身份认证、连接器权限继承自底层企业系统(权限始终跟随员工既有授权范围,避免 AI 获得越权访问)、隐私评估、安全审查、责任 AI 原则、持续监控与明确的人类问责,共同构成员工敢于负责任地实验的信心来源。这与 Agent Guardrails(Agent 护栏)的「动作前审批 + 最小权限 + 审计」一致,并把它提升为扩散策略而非事后补丁。

在能力层,Univé 同时使用 Workspace Agents(工作空间智能体)与约 1,500 个自定义 GPT。两个具体用例落在流程层:

用例Agent 准备的工作人类保留的决定
宠物保险理赔组装卷宗、审核兽医发票、核对保单、识别缺失信息、标记异常、准备可追溯建议理赔专员做出并完全负责每个最终决定
承保审查工作队列、汇总已批准企业来源、识别缺失文档、标记风险指标、标出优先案件承保人关注需专业判断的部分并做决策

这条分工可概括为“AI prepares the work; people make the decision”,与 Human-Agent Teams的起草到有界执行等级一致。准备时间从数小时压缩到数分钟,但来源未给出任务验收方法、返工率、异常处理成本或错误率,不能把准备提速直接外推为整体理赔质量提升。下一阶段 Univé 在探索让 workspace agents 主动在多个已批准企业系统间准备周期性工作、汇总上下文、为每个工作日生成证据型起点。

Univé 披露的采用层数据包括 97% 的 ChatGPT Enterprise 许可证激活、85% 的持证用户周活、每人每周约 40 次 prompt、约 1,500 个自定义 GPT,以及覆盖理赔、承保、财务、人力、法务、IT、客服与管理等几乎全部知识职能。这些是采用层证据,不是流程或结果层证据;来源没有给出客户满意度、处理质量、成本或安全事件指标。但其可参考之处不在数字本身,而在它把扩散从“是否用 AI”转到“下一步该建什么”。

工作流即运营能力:Basis、Clay 与 Exa Labs

OpenAI 的 Enterprise Signals 企业数据为「四层推进」提供了一个量化佐证。按每月每活跃用户输出 token 数对企业排序,前 10% 的企业(frontier firms,前沿企业)与中位企业(45–55 分位)之间的前沿差距从 1 月的 2.6× 扩大到 6 月的 8.3×,增幅超过三倍。OpenAI 把差距归因于三类行为差异:前沿企业更常把 Agent 接到公司上下文与工具、委派更实质的工作、并让成功的工作流更容易重复——也就是上面第 3、4 层的做法密度不同,而不是模型本身不同。

2026 年 9 月的案例文章用三家初创公司把这条差距翻译成可操作的模式。Basis(为会计事务所构建 AI Agent)、Clay(面向 GTM 团队的自学习收入引擎)与 Exa Labs(为 AI Agent 提供网页搜索基础设施)的进阶路径一致:教 Agent 一个稳定的流程 → 随工作变化保持持久上下文 → 把机会带进经过测试的行动

公司模式关键机制可观察结果
Basis已验证流程 → 可复用 Skill入职 Skill 带明确触发器、已知步骤、工具访问与「完成」定义,HR 随异常迭代首日入职从 2 小时缩到 30 分钟
Clay上下文 + 持久化,保持演进的工作最新每账户一个持久 workspace + 专属 subagent,夜间刷新、清晨汇总每晚省约 1 小时收件箱分诊
Exa Labs工具 + 测试 + review,把信号带进有界执行Codex 按既定工作流监测机会、收上下文、建 PR、跑测试、发周报机会从 signal 变成 tested artifact

Basis:把入职变成可教授的 Skill

Basis 为会计事务所构建 AI Agent,新员工首日入职从两小时缩到 30 分钟。员工第一天即获得 Codex 访问权与公司专属的 onboarding Skill(技能);Codex 负责欢迎、介绍公司关键概念,并在后台用员工的电脑完成集成环境搭建。Basis 先把入职流程完整演示一次,再固化为可复用 Skill,关键要素是清晰的触发器、已知步骤、正确的工具访问与明确的「完成」定义——流程不再依赖某个人的空闲时间,团队仍能介入处理例外与复杂问题;HR 发现重复问题或异常时更新 Skill,再给下一批人使用。这正对应 Skill(技能) 把经验证的局部流程封装为组织可复用资产的机制。

Clay:给分散的工作一个持久的家

Clay 销售团队的关键交易上下文散落在 CRM、邮件、Slack、通话、演示稿、短信与内部讨论里。一位 GTM 工程师的替代做法是:每个客户账户一个持久 workspace 与专属 subagent,subagent 夜间审阅一手来源并更新各自的 deal 文件夹;每天早晨一个协调 Agent 把全部账户的更新汇总成一份简短的优先行动清单(回答遗留问题、补购买委员会缺口、给客户重新参与的理由)。据 Clay 自述,该工作流每晚省下约一小时收件箱分诊;每条建议都紧贴支撑证据,销售能在行动前核查一手来源。文章把这类「演进中的工作」可规模化所需的四要件概括为:一致的结构、有用的刷新节奏、共享的证据、行动点上的人类判断——没有共享证据与人工把关,刷新就只是噪音。

Exa Labs:把机会带进经过测试的行动

Exa Labs 的目标「Exa everywhere」需要 devrel 与客户团队监测仓库与生态、识别有前景的集成、收集上下文并跨系统协调。虽然机会各不相同,从发现到实现的路径却遵循一致序列,Exa 把它定义成 Codex 的既定工作流:明确优先级和可访问来源,人工 review 前不发货。Codex 现在监测高优先级集成机会、收集相关上下文、创建 PR、运行测试,并用 Slack 与 Notion 等来源准备每周更新;合适时还会起草下一步(包括对外公告初稿)供团队评审。工作流把机会从信号一路带到经过测试的产物,压缩了研究、工程与沟通之间的交接。人仍然决定哪些机会重要、公司做出哪些承诺、外部关系如何管理;测试与 review 点让 Agent 的工作在发布前可见,也让团队在下一次运行前知道该调整哪里。

共性:改进内建于工作流

三家的改进都长在工作流内部,而非事后补丁:入职异常暴露 Skill 需要细化处;新账户活动与销售验证保持 deal 上下文新鲜;测试与人工 review 磨砺未来执行的边界。每家都从一个具体岗位 + 足够的试验空间起步,分工在使用中逐渐清晰,责任随工作流证明自身而扩展。这与前文 Univé 的「AI prepares the work; people make the decision」及 Human-Agent Teams 的边界一致,但多出一层:工作流本身是改进对象,不是一次部署即终态的自动化。

如何区分“采用”与“转型”

席位数、月活和调用量能说明采用程度,却不能独立证明转型成功。德国电信披露超过 5 万月活用户和年初以来 546% 的使用增长,这些数字表明扩散速度,但来源没有给出客户满意度、首次解决率、转接率、通话时长、网络质量或单位成本等结果指标。NTT DATA 披露约 9,000 名员工使用 Codex,且在发布使用指南和进行实操培训后,周活用户增长到原来的 1.4 倍;其内部问卷中,超过 96% 的受访者表示满意 ChatGPT Enterprise,超过 95% 报告生产力提升。这些数字仍主要是采用层证据,公开材料没有给出问卷样本量、题目设计和客观基线。

NTT DATA 的故障分析案例更接近流程层:一项原需 5 名资深工程师 3 天完成的复杂分析,用 Codex 在 30 分钟内完成。非技术员工也开始用它跨文件整理资料、分析 Excel、填写差旅表单和制作报告。不过来源没有给出任务验收方法、人工复核成本、错误率或重复运行结果,不能把单次成功直接外推成稳定业务结果。

因此评估至少应分三层:

层次可观察问题示例指标
采用人们是否实际使用?活跃用户、调用量、覆盖团队
流程工作路径是否改变?等待与转接、人工接管、处理周期、返工率
结果与风险改变是否带来可持续价值?客户满意度、问题解决率、成本、网络质量、安全事件、数据合规

这一区分也适用于 Evals(评估):离线模型得分不能替代真实流程指标,而使用增长也不能替代质量和安全验证。

OpenAI Presence提供了一个更接近结果层的案例。OpenAI 的英语电话支持 Agent 上线数周后可在无需人工协助时解决 75% 的呼入问题,其 Codex 改进循环又在 10 天内将人工 handoff 降低 15 个百分点。与席位或调用量相比,这些指标直接描述流程路径是否改变;但来源没有给出客户满意度、成本、样本量和分场景错误率,所以仍不能只凭“自动解决率”判断整体转型质量。

新加坡电信公司 Circles 把这类流程指标带进了第三方客户服务场景。其 CareX 多智能体架构把编排智能体与账单、订阅、网络、账户等专门智能体结合,按需路由解决任务,并在升级时把完整上下文转给人类客服——从第一周 55% 到当前 65% 的自主解决率,并设定扩展实时语音后 95% 的目标(与 OpenAI Presence 的语音方向一致)。它强化了两个通用要点:成果应落在“自主解决率 / 人工接管”这类流程指标而非席位;治理要落在模型层之前(PII 识别加密、专门智能体最小作用域访问),这正对应 Agent Guardrails(Agent 护栏) 的最小权限原则。其 Xplore IQ 也给出结果层自述——新加坡 ARPU 提升 22%、流失率降低 9%——但来源未披露实验设计,仍属厂商自报。

六步法:把最强实验变成可复制的运营实践

基于上述案例与 Enterprise Signals,OpenAI 给企业领导一份从「允许实验」到「规模化复制」的六步清单。前提是让实验可见、可复用:其研究发现,采用六个月后早期职业员工比高管每周多发 13 条消息——新员工更快把 AI 编进日常,领导者的任务是把有效的个人用法连同过程与证据打包成 Skill(技能)、Plugins 或共享 workspace,而不是只统计使用量。

  1. 选定一个有份量的价值面:从一个端到端工作流切入,让战略优先级、系统、交接、控制与可衡量的利害在其中交汇。它既要重复得足够频繁以便从中学习,又要重要得足以值得重新设计。
  2. 定义结果与度量:指定负责任的 owner、KPI、基线与护栏。深度用完成任务数、连接的上下文与工具、异常数、review 负载跟踪;价值用周期时间、质量、成本、收入或风险跟踪。输出量只能说明人们在要求 AI 做更多,工作流结果才能说明它是否重要——与前文「采用 / 流程 / 结果」三层框架一脉相承。
  3. 写 Agent 的职位描述:定义什么触发工作、期望结果、所需上下文、工具与权限,以及 Agent 应多持久地朝完成推进;明确它必须产出什么证据、在何处停下等人工 review。
  4. 在 Agent 周围建人的系统:让离工作流最近的人进入设计循环,写明谁拥有业务结果、领域逻辑、访问与控制、采用与日常使用。初创公司几个人就能压缩这些职责;企业规模化时必须把决策权显式化。
  5. 匹配工作模式:Chat 适合问答与快速协作,ChatGPT Work 适合多步知识工作与成品交付,Codex 适合技术执行——不同价值面用不同模式承载。
  6. 把运营模式向前带:保留已验证的上下文、权限、评估、review 点、owner、度量与赋能方式,应用到下一个价值面,让每个新实验都给下个团队更好的起点。

这六步补全了「四层推进」第 3、4 层的操作细节:先选一个价值面证明闭环,再把成功的组合原样搬到相邻工作流,而不是同时铺开所有流程。它与 NTT DATA 的「发现—验证—扩散」CoE 链条一致,只是把起点下放到单个具体工作流,让组织管理与治理沉淀在实际被验证的做法之后。

组织与治理含义

NTT DATA 的案例把 CoE 的职责具体化为一条“发现—验证—扩散”链:监测采用情况,结合问卷与访谈发现摩擦;验证高影响用例;再通过指南、实操培训和 Skill(技能)把做法推广到其他团队。公司披露其用 Playwright 自动化内部系统日常操作,并把自动化封装为 Skills 供组织复用。组织知识只有从个人 prompt 和一次性脚本进入可维护资产,才可能形成跨团队复利。

自上而下的方向与自下而上的实验承担不同职责。领导者需要为流程变化而非许可证采购负责;一线员工则能发现高频痛点、例外情况与不适合自动化的边界。两者之间需要明确的流程负责人,把零散实验变成可重复、可审计的生产工作流。

当 AI 进入客服、语音网络和网络运营后,风险面也从“回答是否准确”扩展到企业数据访问、实时输出、工具动作和基础设施控制。数据保护、数据主权与安全不能只是发布前检查,而应落实为最小权限、人工接管、持续 Evals(评估)、审计与 Agent Guardrails(Agent 护栏)。德国电信案例强调了这些原则,但没有披露具体控制设计;NTT DATA 则公开了需要明确数据范围、系统连接、网络流量、沙箱模式、自动化程度和人工复核位置,但没有公开各项策略值。两者都不足以提供可直接复制的控制配置。

在人机分工上,NTT DATA 把人的职责概括为设定方向并评估结果,AI 负责解释信息并推进任务。Univé 把这条原则具体到理赔与承保:AI 负责准备卷宗与证据,专业人员做出并完全负责每个最终决定。两者都与 Human-Agent Teams 的边界一致:扩大委派范围不等于移交目标设定、结果责任和高风险决策。

相关概念

  • Workspace Agents(工作空间智能体) — Univé 用以准备理赔与承保工作的共享团队 Agent 能力
  • ChatGPT Work — 六步法中「多步知识工作与成品交付」模式对应的产品执行面
  • GPT-Live — AI 嵌入实时语音渠道时的交互层案例
  • Evals(评估) — 把采用、流程、业务结果和风险分层验证
  • Agent Guardrails(Agent 护栏) — 企业部署中的权限、审批与安全边界;Univé 把它当作扩散加速器
  • OpenAI Presence — 把语音与聊天 Agent 嵌入企业流程,并以生产指标和受控改进持续运营的案例
  • Codex — NTT DATA 将可执行任务从工程场景扩展到非技术岗位的 Agent 产品
  • Skill(技能) — 把经验证的局部自动化封装为组织可复用资产
  • Human-Agent Teams — 人设定方向并评估结果、Agent 解释信息并推进任务的责任分工
  • Circles — 新加坡电信公司将多智能体编排与个性化引擎嵌入客服与营销触点的案例
参考来源
  1. 1. https://openai.com/index/ai-native-company-workflows
  2. 2. https://openai.com/index/deutsche-telekom/
  3. 3. https://openai.com/index/introducing-openai-presence/
  4. 4. https://openai.com/index/ntt-data/
  5. 5. https://openai.com/index/unive/
  6. 6. https://openai.com/index/circles
评论