Claude in Chrome
Claude in Chrome 是 Anthropic 让 Claude 在浏览器里工作的产品形态,最初作为 pilot 发布,在收紧了 Prompt Injection(提示注入)防护后于全部付费 Claude 订阅上正式可用(GA)。它解决的是"工具无法接入的内容":内部看板、遗留系统、供应商门户往往没有 Connector 或稳定 API,但 Claude in Chrome 能直接读取用户当前所在页面,并复用现有登录态去查看、读入、输入文本、点击链接、翻页和填表。
它和 Claude Code 的 Auto Mode 共享同一套自主审批机制,是浏览器这一端的"Agent 访问真实界面"例子,参见 Computer-Using Agent(计算机使用模型)和 Agent-Computer Interface(智能体计算机接口)。
自主行动与审批
GA 之前,Claude 在 Chrome 里每一步动作都要用户批准;GA 后它可以自动批准判定为安全的动作,原理与 Claude Code 的 Auto Mode 一致,也可以在设置里关掉改回手动审批。自主动作的对象是浏览器内真实操作:导航、输入文本、点击、填表,由于复用了用户已有登录,这让 Agent 能触达只有用户本人可见的内部系统。
能力扩展的同时,风险边界也从"输出一句话"扩展到"在真实界面执行动作"——这正是 prompt injection 攻击面扩大的地方。
三层 prompt injection 防护
flowchart LR
W["网页 / 邮件 / 表单\n可能藏恶意指令"] -->|"tool result"| P["Probe 扫描\n检测潜在注入"]
P -->|"命中则告警"| M["Claude 模型\n(针对攻击库反复训练)"]
M -->|"拟执行动作"| C["Safety classifier\n对照原始用户请求"]
C -->|"不匹配则阻断"| X["动作被 block"]
C -->|"匹配则执行"| E["浏览器动作\n导航 / 输入 / 点击 / 填表"]
- 模型先被喂进攻击样本:训练集是持续增长的 prompt injection 攻击库,来源包括内部自动化攻击者、外部红队和真实世界监控。一旦新攻击在当前模型上得手,就加入库中,反过来训练后续模型与已部署的防护。
- probe 先扫描网页内容:网页内容经工具结果进入模型上下文前,先用 probe 扫描是否像 prompt injection,命中则警告模型对内容保持怀疑、必要时在执行前向用户确认。probe 最早随 Claude Opus 4.5 部署,后续扩展了覆盖的攻击类型。
- 动作执行前过分类器:模型即将动作(导航、输入文本等)时,分类器对照用户最初请求核验;不匹配则阻断。这个设计让"自动批准"有了安全闸门,也和 Claude Code 中"只看用户消息和可执行动作、不看模型自我辩解"的 transcript classifier 一脉相承。
评估数据
Anthropic 报告了 prompt injection 抵御的两次评估。最初对齐 Claude Cowork 浏览器 side panel harness 的评估因 0% 成功率而饱和被退役;当前评估改用更强攻击(门控红队来源),成效显著:
| 模型 | 无防护 | 加 probe | 加 probe + 安全分类器 |
|---|---|---|---|
| Opus 4.5 | 17.6% | 16.7% | — |
| Opus 5 | 3.8% | — | 0% |
| Sonnet 5 | — | — | 0% |
| Mythos 5 | — | — | 0% |
| Fable 5 | — | — | 0.3% |
从 Opus 4.8 起,所有模型在 probe + 安全分类器下接近零成功(Sonnet 5 / Opus 5 / Mythos 5 为 0%,Fable 5 为 0.3%),成功突破均落在低严重场景且经人工核实。注意并非所有攻击都会"到达"模型——Claude 的动作本身有时会让它压根遇不到恶意指令。这仍是多层风险概率而非零风险保证,与 Agent Guardrails(Agent 护栏)中的纵深度一致。
边界与分发
- 只运行在 Chrome(Chromium 系其他浏览器与移动端尚不支持),工作电脑上的文件与其他应用仍需 Claude 桌面应用。
- Enterprise 计划由管理员在 Organization Settings 里管,可限制仅授权域名。
- 安装入口为 Chrome Web Store,GA 覆盖所有付费订阅。
相关概念
- Claude Code — 共享同一套 Auto Mode 自主审批机制
- Computer-Using Agent — 另一家(OpenAI)的界面操作 Agent,作对比
- Agent Guardrails(Agent 护栏) — prompt injection 防护、动作前分类的原则底座
- ACI — 让 Agent 面向视觉 UI 工作时的接口设计问题