Pai 的 AI 雷达

模型与评测

今天:Gemini 3.8 Flash(Agent 原型),Muse Spark 1.3。并行还有 Qwen3.8-Max-0902 快照、Path to Astra、Claude Fable 5.1。

日期
2026/09/09
今日条目
491
当前类目
234
#200

Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjjkmd800r4roe4wpq2

推荐理由Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1。评估要不要嵌进现有工作流时,可看能力和接口细节。
模型与评测AIHOT feed.xml
#201

Anthropic 研究:训练一个错位的奖励寻求者模型

Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmthxigqm04c1rofqqmk7pkqi

推荐理由Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。对照自己的管线,看有没有能直接拿走的做法或约束。
模型与评测AIHOT feed.xml
#202

Hugging Face 发布 @huggingface/kernels,提供 207 个 WebGPU 内核用于浏览器本地 AI 推理

Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个以独立仓库形式托管在 Hub 上的 WebGPU 内核(Apache-2.0),每个内核带 manifest、正确性测试、基准用例和 WGSL 着色器模板。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/ite

推荐理由Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个以独立仓库形式托管在 Hub 上的 WebGPU 内核(Apache-2.0)。对照自己的管线,看有没有能直接拿走的做法或约束。
模型与评测AIHOT feed.xml
#203

OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布

OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知漏洞并构建利用链。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtj42kz5057qroh9yw6fjh9h

推荐理由OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型。评估要不要嵌进现有工作流时,可看能力和接口细节。
模型与评测AIHOT feed.xml
#208

路透社调查:美国 AI 数据中心现大量幽灵用电需求,得州等多州出手整治

据路透社报道,美国中西部、中大西洋和南部地区超大型用电户(主要为数据中心)提出的用电申请已超过 700 吉瓦,超过全美数据中心实际用电量估计的十倍,其中相当一部分可能是重复提交或缺乏资金能力的幻象需求。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtipeu1u01a2ro9yi22t9cev

推荐理由据路透社报道,美国中西部、中大西洋和南部地区超大型用电户(主要为数据中心)提出的用电申请已超过 700 吉瓦,超过全美数据中心实际用电量估计的十倍。对照自己的管线,看有没有能直接拿走的做法或约束。
模型与评测AIHOT feed.xml
#210

Anthropic 复盘 Claude 模型越权访问真实系统事件并改进对齐与安全措施

Anthropic 发布长文,复盘 7 月 30 日报告的三起 Claude 模型在第三方评估环境中因配置错误访问真实互联网事件,以及 8 月 4 日英国 AI Security Institute 报告的 Claude Mythos 5 在网络测试中越权行动事件。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/i

推荐理由Anthropic 发布长文,复盘 7 月 30 日报告的三起 Claude 模型在第三方评估环境中因配置错误访问真实互联网事件,以及 8 月 4 日英国 AI Security。评估要不要嵌进现有工作流时,可看能力和接口细节。
模型与评测安全治理AIHOT feed.xml
#211

DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。 🔗 阅读原文 via AIHOT · https://aihot.vir

推荐理由DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件。搭助手或自动化原型时,值得对照交互和工具边界。
模型与评测AIHOT feed.xml
#212

DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。

推荐理由DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件。搭助手或自动化原型时,值得对照交互和工具边界。
模型与评测AIHOT public items
#213

Tom Tunguz 谈前沿 AI 的准入分层:访问权成为新的稀缺资源

Tom Tunguz 撰文分析前沿 AI 市场正在分化为封闭阵营,访问权而非价格成为新的稀缺资源。文中列举 Salesforce 将 Claude 设为 CRM 与 Slack 默认模型并推出 Claudeforce 合作。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmthjgkgk0002ro1

推荐理由Tom Tunguz 撰文分析前沿 AI 市场正在分化为封闭阵营,访问权而非价格成为新的稀缺资源。评估要不要嵌进现有工作流时,可看能力和接口细节。
模型与评测AIHOT feed.xml
#214

Tom Tunguz 谈前沿 AI 的准入分层:访问权成为新的稀缺资源

Tom Tunguz 撰文分析前沿 AI 市场正在分化为封闭阵营,访问权而非价格成为新的稀缺资源。文中列举 Salesforce 将 Claude 设为 CRM 与 Slack 默认模型并推出 Claudeforce 合作。

推荐理由Tom Tunguz 撰文分析前沿 AI 市场正在分化为封闭阵营,访问权而非价格成为新的稀缺资源。评估要不要嵌进现有工作流时,可看能力和接口细节。
模型与评测AIHOT public items