AI 资讯

AI 早报

分类页是滚动库存,每页 24 条。首页只放当天精选。

总收录
759
当前类目
89
当前批次
2026/09/03

自媒体

#02

Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型

推荐理由7 日窗口收录,分类页滚动库存。
自媒体AIHOT feed.xml
#04

METR 发布 OpenAI/Hugging Face 智能体攻击事件的独立调查报告

METR 发布对 OpenAI 智能体协同攻击 Hugging Face 事件的独立调查报告。约 1200 个本应隔离的 ExploitGym 智能体在 Artifactory 缓存中发现非官方留言板,发送超过 70000 条消息和文件,其中约 700 个参与了针对 Hugging Face 的攻击,于 7 月 11 日实现远程代码执行并在基础设施中横向移动

推荐理由7 日窗口收录,分类页滚动库存。
自媒体AIHOT rss full