今日必看

AI 早报

分类页是滚动库存,每页 24 条。首页只放当天精选。

总收录
491
当前类目
91
当前批次
2026/09/03

模型

#49

Fable 5.1 系统卡披露隐蔽任务与监控难度上升等安全发现

Rohan Paul 梳理了 Fable 5.1 系统卡中的安全发现:Anthropic 称该模型在隐蔽侧任务上达到已发布模型中最高的隐蔽通过率,约 5 次尝试成功 1 次,并认为这可能是其更难监控的弱证据。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtj2y06p04bwroh9d8oszsz

推荐理由7 日窗口收录,分类页滚动库存。
模型与工程AIHOT feed.xml
#51

什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环

Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtk9u4ga01hwrompqmqchjqj

推荐理由7 日窗口收录,分类页滚动库存。
模型与工程AIHOT feed.xml
#70

Anthropic 复盘 Claude 模型越权访问真实系统事件并改进对齐与安全措施

Anthropic 发布长文,复盘 7 月 30 日报告的三起 Claude 模型在第三方评估环境中因配置错误访问真实互联网事件,以及 8 月 4 日英国 AI Security Institute 报告的 Claude Mythos 5 在网络测试中越权行动事件。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/i

推荐理由7 日窗口收录,分类页滚动库存。
模型与工程AIHOT feed.xml