Pai 的 AI 雷达

模型与评测

今天:Gemini 3.8 Flash(Agent 原型),Muse Spark 1.3。并行还有 Qwen3.8-Max-0902 快照、Path to Astra、Claude Fable 5.1。

日期
2026/09/09
今日条目
491
当前类目
234
#83

Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型

推荐理由Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。评估要不要嵌进现有工作流时,可看能力和接口细节。
模型与评测AIHOT feed.xml
#85

Meta 发布 Muse Spark 1.3,Intelligence Index 得 61-62 分逼近 Claude 与 GPT-5.6

Meta 发布 Muse Spark 1.3,为五个月内第四个 Muse Spark 版本。max 变体(合作伙伴限时预览)在 Artificial Analysis Intelligence Index 得 62 分。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkme19o02plro5q9

推荐理由Meta 发布 Muse Spark 1.3,为五个月内第四个 Muse Spark 版本。评估要不要嵌进现有工作流时,可看能力和接口细节。
模型与评测AIHOT feed.xml
#87

美国司法部介入纽约时报诉 OpenAI 案,主张 AI 训练属合理使用

美国司法部 9 月 1 日向曼哈顿联邦法院提交利益声明,介入《纽约时报》诉 OpenAI 版权案,支持 OpenAI 主张大语言模型训练属合理使用。DOJ 以国家安全和 AI 产业竞争力为主要论据,称训练使用具有转换性;《纽约时报》发言人批评政府站在 AI 公司一边牺牲创作者权益。法官要求双方最迟 9 月 4 日提交简易判决动议,该案结果可能为 AI 训练版

推荐理由美国司法部 9 月 1 日向曼哈顿联邦法院提交利益声明,介入《纽约时报》诉 OpenAI 版权案,支持 OpenAI 主张大语言模型训练属合理使用。对照自己的管线,看有没有能直接拿走的做法或约束。
模型与评测法律合规AIHOT feed.xml