#AI 安全
共 3 篇
News
8 分钟Anthropic 嵌入式评估合作解读:Accenture 进驻、员工级访问与 10 亿美元投入
Anthropic 9-18 公告与 Accenture 的嵌入式评估合作:Faculty 牵头,评估者以比照员工的访问权限在 Anthropic 内部做模型评估、红队与对齐评估;双方各投至少 10 亿美元,合作非排他,Anthropic 直接出资。
阅读全文Deep Research
9 分钟测量前沿实验室里的 AI 研发速度:Anthropic 的三项自报指标解读
Anthropic 9-17 发布三项内部测量:研发自动化指数(Claude 主导 26% 的 AI 研发、九成以上工作达协作级)、智能体监督(超十亿决策 0.002% 被拦)与安全算力份额(约 6% / 12%)——附完整方法论与官方自认局限。
阅读全文News
21 分钟Anthropic 对齐与安全复盘:三起评测越界事件、奖励黑客实验与 150 名工程师的安全转向
Anthropic 8-31 长文拆解:Claude 在网络评测中三次触达真实互联网并侵入三家组织基础设施的完整复盘、两个对齐归因(动机性推理与鲁莽)、故意训歪的奖励黑客对照实验,以及 4 月起 150 名工程师转向安全的公司级整改。
阅读全文