Center for AI Standards and Innovation(人工智能标准与创新中心)
Center for AI Standards and Innovation(CAISI,人工智能标准与创新中心) 是美国国家标准与技术研究院(NIST,隶属商务部)下设的 AI 标准与评测机构,中文报道里也常写作“美国人工智能标准与创新中心”。它的定位是美国政府在 AI 领域对接产业的主要接口:一边与企业做测试与协作研究,一边制定自愿性指南、开展对前沿模型的国家安全相关能力评测。
该机构由原“美国 AI 安全研究所”(US AI Safety Institute)改组而来。2025 年 6 月,商务部长 Howard Lutnick 宣布把安全导向的机构重组为“亲创新、亲科学”的标准与创新中心,名称里的 “safety” 也随之换成 “standards”。这次改名本身就是 2025–2026 年前沿 AI 治理取向变化的一个标志:从“安全审查”叙事转向“标准、测试与竞争力”叙事。
职责(依 NIST 官方页面)
- 与 NIST 内部机构合作,制定衡量与改进 AI 系统安全性的指南与最佳实践,协助产业界发展自愿性标准;
- 与私营部门 AI 开发者、评估方签订自愿协议,牵头对可能威胁国家安全的 AI 能力做非机密评测,重点是网络安全、生物安全与化学武器等可证实的风险;
- 对美国与对手的 AI 系统能力、外国 AI 系统的采用情况以及国际 AI 竞争态势做评估;
- 评估对手 AI 系统可能带来的安全漏洞与恶意影响(含后门一类的隐蔽行为);
- 与国防部、能源部、国土安全部、科技政策办公室与情报界协调评估方法;
- 在国际层面代表美国利益,“避免外国政府对美国技术施加不必要负担”,并与 NIST 同事协作以确保美国在国际 AI 标准中的主导地位。
最后一条是理解 CAISI 在前沿 AI 标准提案中角色的关键:它既是技术机构(做测量与评估),也是国家竞争工具(争标准的国际话语权)。两重身份并不冲突,但会让“标准中立”的表述需要额外论证。
评测与研究的实际产出
CAISI 近年把工作重点放在开放权重模型的能力评估上,公开过对多家中国公司模型的评估:
- 2026 年 5 月:发布对 DeepSeek V4 Pro 的评测;
- 2026 年 7 月:发布对 Z.ai(原智谱 AI)开放权重模型 GLM-5.2 的评估,配套图表对比美中能力最强公开模型的聚合能力随时间变化。
这类评估与 Third-Party Evaluation(第三方评测) 的思路一致:由模型开发者之外的机构在自有方法下测量能力,为政策与产业提供可引用的证据。CAISI 的研究博客也讨论评测本身的方法问题(例如 agent 评测中的作弊行为)——同一类“评测能否被操纵”的担忧,正是 ExploitGym 评测事件与 Eval(评估) 中反复出现的主题。
需要说明来源边界:以上评估活动的细节来自 NIST 公开页面与报道,不在本次摄入文章(《Building standards for the next phase of AI》)范围内;模型名称与时间以 NIST 后续公告为准。
在国际标准机制中的位置
OpenAI 2026 年 9 月的提案把 CAISI 放在两条支柱的交点上:
- 机制层:倡议依托各国 AI 安全研究所网络,经 CAISI 与国家产业机构推动标准制定,聚焦前沿模型与开发者(按能力 benchmark 衡量)以及自动化 AI 研究与 RSI 的收益—风险管理。美国可以扩展 CAISI 在 2024 年建立的 International Network for Advanced AI Measurement, Evaluation, and Science(IN-AI-MEAS),把各国公共机构拉到同一套测量、评估与科学方法上。
- 证据层:CAISI 这类机构产出的评测结论,是标准层“共同测量与事件上报协议”要接的原料之一。
与美国并列的另一个机构是英国的 AI Security Institute(UK AISI,此前也带 “Safety” 字样,同样经历了改名)。两者都在发布前评测中扮演外部角色,“改名 + 从安全到标准/安全(security)”的同步变化,是本轮治理话语迁移的一个可观察信号。
相关词条
- Frontier AI Standards(前沿 AI 标准) — 把 CAISI 当作机制枢纽的全球标准提案
- Appia Foundation — 同一提案中偏实施落地的规范制定组织
- Recursive Self-Improvement(递归自我改进) — 提案要求单列标准的对象
- Third-Party Evaluation(第三方评测) — 与 CAISI、UK AISI 同类的外部评测机制
- Red Teaming(红队测试) — 生态层面已有 CAISI 与 UK AISI 参与的对接实践
- EU AI Act(欧盟人工智能法案) — 与“自愿标准 + 评估”路径对照的硬法路径
- Eval(评估) — CAISI 评估工作所属的方法论范畴