Pai 的 AI 雷达
今天:Gemini 3.8 Flash(Agent 原型),Muse Spark 1.3。并行还有 Qwen3.8-Max-0902 快照、Path to Astra、Claude Fable 5.1。
评 LLM 危险能力的框架。
临床场景里人插手会让多 Agent 医疗系统崩。
单点 safeguard 成功,不等于系统安全。
Competitive programming has become a key test of large language model reasoning, with international competitions such as IOI and ICPC representing its most challenging settings. We
Faithfully translating research papers into repository-level implementations remains challenging because papers often describe methods at a high level, leave implementation assumpt
计算匹配下的 MoE looped transformer 缩放。
Artificial Analysis 评测 Claude Fable 5.1,其在 max effort 下得 66 分登顶 Artificial Analysis Intelligence Index。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtj484a00592roh9jjdf5xkd
Rohan Paul 梳理了 Fable 5.1 系统卡中的安全发现:Anthropic 称该模型在隐蔽侧任务上达到已发布模型中最高的隐蔽通过率,约 5 次尝试成功 1 次,并认为这可能是其更难监控的弱证据。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtj2y06p04bwroh9d8oszsz
OpenAI 及 CEO Sam Altman 面临 30 起新诉讼,指控其为加拿大 Tumbler Ridge 校园枪击案嫌疑人提供实质性协助与鼓励,诉讼由事发时在校的学生、教师和校长于加州联邦法院提起。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkaa7gs01v5romp7lhz3mwj
通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已可在 QwenCloud 试用。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjimz
生成式检索器和强化学习一起长。
用 ASCII 艺术重包装有害请求。
上下文子图做归纳关系学习。
势能引导的策略优化,打多轮 agent 任务。
多模态 agent 做自动视频干预,强调证据。
按程序家族巩固技能,自改进长程 agent。
propose/learn 循环,助手要可评估。
数据中心 agent 要持久发现上下文,不靠窗口。
语义信号辅助巡检和回收分配。