OpenAI Presence
OpenAI Presence 是 OpenAI 面向企业部署实时语音与聊天 Agent 的托管产品。它不是只提供一个模型或自助式开发框架,而是由 OpenAI Forward Deployed Engineers(FDE)和指定系统集成商参与交付,把业务知识、系统访问、标准操作程序、权限策略、Agent Guardrails(Agent 护栏)、人工升级、模拟测试与上线后的改进流程组合起来。
Presence 首先为 Agent 划定一项具体工作,例如处理账单问题、支持保险理赔或解决员工 IT 服务请求。Agent 只获得完成该工作所需的知识与系统权限;企业负责规定它能做什么、哪些动作需要审批、何时必须交给人类。这种边界使 Presence 更接近一个生产 Agent 的受控运行与运营系统,而不是通用聊天机器人。
产品闭环
Presence 将发布前测试、生产运行和发布后改进连接成一个受控闭环:
flowchart LR
J["定义具体工作\n知识、系统与最小权限"] --> P["配置 SOP、策略\n护栏与升级规则"]
P --> S["模拟常见请求\n边缘与高风险场景"]
S --> G{"Graders 与策略检查\n结果、工具、升级是否正确?"}
G -->|"未通过"| P
G -->|"通过"| D["受控部署\n语音或聊天"]
D --> O["生产会话、升级\n质量与业务信号"]
O --> C["Codex + Presence plugin\n调查并提出更新"]
C --> T["对照生产版本测试"]
T --> A{"团队审批?"}
A -->|"否"| C
A -->|"是"| R["受控 rollout"]
R --> O
这里 Codex负责调查生产信号并提出候选修改,团队仍掌握测试、批准和 rollout。改进对象不只是 prompt,也包括 SOP、策略和护栏;因此生产反馈不会直接、不受控地改写线上 Agent。
发布前与发布后的信任机制
发布前,团队可用模拟和 grader 覆盖常见请求、边缘情况与高风险场景,检查四类问题:
- 是否得到正确结果;
- 是否遵守业务策略;
- 是否正确使用工具;
- 是否在合适时机升级给人类。
上线后,Evals(评估)不再只依赖静态测试集。生产会话、人工升级和质量信号会暴露新缺口,再被转成候选修复与回归测试。Presence 的核心运营逻辑是:生产轨迹用于发现问题,Codex 生成候选变更,离线对照和人工审批决定是否部署。
产品界面示意图还展示了更具体的控制面,但其中数值属于 mockup,不能当作客户实测结果:
| 控制面 | 示例字段 |
|---|---|
| 会话与动作 | 语音 transcript、聊天消息、订单查询、退款等工具动作 |
| 模拟测试 | 按 Guardrail、Refunds、Cancellation、Email and OTP verification、Account deletion、Public outage 分组 |
| 生产健康 | response accuracy、voice experience quality、volume、response latency、task performance |
| 业务分布 | customer intent,例如 account access、billing subscription、technical interface、usage guidance、cancellation |
这组界面说明 Presence 同时观察结果质量、语音体验、延迟、流量、任务表现和意图分布,而不是把“模型回答准确率”当作唯一生产指标。
已披露的生产结果
Presence 支撑 OpenAI 的英语电话支持渠道 1-888-GPT-0090。OpenAI 披露,该 Agent 可以处理开放式请求、验证来电者、读取账户上下文并执行获批动作;上线数周内达到或超过其用于评价一线人工客服质量的 benchmark,并能在无需人工协助的情况下解决 75% 的呼入问题。其 Codex 驱动的改进循环在 10 天内将人工转接率降低了 15 个百分点。
需要区分两个口径:75% 是无需人工协助解决的呼入问题占比,15 个百分点是人工 handoff 的变化,不应把后者误写成 15% 的相对下降。来源没有披露样本量、置信区间、成本、客户满意度或分场景错误率,因此这些数字能证明产品已进入真实生产,但不足以独立评价所有部署的效果。
OpenAI 同时列出三个早期企业方向:BBVA 在墨西哥探索日常银行业务的语音支持,SoftBank 测试自然日语客服对话,IAG 探索在恶劣天气等高需求事件中提供及时支持。原文使用的是 exploring 或 testing,不能写成已经全面上线或已经取得量化成效。
渠道、复用与交付边界
Presence 当前覆盖 customer support、outbound sales 和高风险内部工作流等实时语音与聊天场景。企业可以把策略、评估和升级规则作为跨部署的一致层,再按具体工作流或渠道调整知识、权限和交互。这使新场景能复用已验证控制,而不是从零开始。
截至发布时,Presence 通过 limited general availability 向符合条件的企业客户提供,不是自助式产品。部署由 OpenAI FDE 与指定全球系统集成商主导;若用例超出当前产品支持范围,也依赖这些工程团队和合作伙伴推进。它与 OpenAI API 的边界因此很清楚:API 提供可组合的模型与工具能力,Presence 提供带交付服务的企业生产 Agent 产品。
相关概念
- Agent Guardrails(Agent 护栏) — 权限、审批、策略执行与人工升级的控制层
- Evals(评估) — 模拟、grader、生产质量信号与版本对照测试
- Codex — 调查生产信号并提出候选更新的改进 Agent
- Harness Engineering(驾驭工程) — 将模型、工具、策略、评估和运营组合为生产系统的工程视角
- 企业 AI 原生转型 — Presence 所代表的“嵌入客户触点与核心运营”阶段