Gemini 3.8 Flash + Flash Cyber
六周内第三次 Flash:工作马 3.8 Flash 走编码/Agent,Cyber 走漏洞发现与补丁。入门价 $0.75/$3.75,年底翻倍。API、AI Studio、Gemini 应用可用。
今日必看
今天最重要的 AI 变化。频道按你关心的领域,雷达按来源发现。
六周内第三次 Flash:工作马 3.8 Flash 走编码/Agent,Cyber 走漏洞发现与补丁。入门价 $0.75/$3.75,年底翻倍。API、AI Studio、Gemini 应用可用。
官方模型页:四月以来第四个 Spark 检查点,Muse Code 和 Meta Model API 可用。相对 1.2 更省 token 和工具调用。
阿里云文档 9 月 2 日更新:2.4T MoE 后训练快照,强化工程级编码和多工具协作,1M 上下文。新加坡标价 $2/$6。
NVIDIA 系列第三篇:怎么训/选 draft 模型和校验设置,加速 decode 还不掉点。
Google 发布当天插件跟上:gemini-3.8-flash,低/中/高 thinking,修了异步日志。
Astra 是 OpenAI 首个 Preparedness Critical 档:带工具可自行找未知漏洞并做利用链。部分研发推迟,网安能力先给测试再给 Daybreak Blue。
用心理测量看常见 LLM 评测是不是在测同一潜变量。别把榜上 0.5 分当成能力跃迁。
Google AI 讲评测量表,避免法官模型胡打分。
同一底座两套护栏。Fable 5.1 公开(1M 上下文,$10/$50),Mythos 5.1 仅受邀,走 Project Glasswing 做网安和生命科学。
医疗机构把可信病历和行业数据接到 ChatGPT,在既有治理下查患者上下文,而不是往对话框贴病历。
企业默认模型不再锁死一家。
App 和 CLI 都可排除路径,不送进模型。
DeepMind 博客版,和 Google 产品博客同一发布。
官方客户故事。
当 agent 能改测试套件,绿勾还有没有意义。
Simon 用新模型做动画鹈鹕,当能力探针。
分析各 lab 公开代码的工程就绪度。
I got nerd sniped and ran a bunch of evaluations to see how well models could play Redactle. It turns out Gemini flash is in a league of it's own in both performance and cost. It's
Article URL: https://careeratlas.dev/writing/ai-displacement-model Comments URL: https://news.ycombinator.com/item?id=49540866 Points: 4 # Comments: 1
改对话再复用 thinking block 会报错。
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkbdbti01n8roz5k5kt1g98
Meta 发布 Muse Spark 1.3,为五个月内第四个 Muse Spark 版本。max 变体(合作伙伴限时预览)在 Artificial Analysis Intelligence Index 得 62 分。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkme19o02plro5q9
Meta 发布 Muse Spark 1.3,是五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkkcguj04aurollf1lq9a9s
清华大学与美团学术论坛开放报名,主题对准物理世界 AI 与大模型,覆盖具身与世界模型。
美国司法部 9 月 1 日向曼哈顿联邦法院提交利益声明,介入《纽约时报》诉 OpenAI 版权案,支持 OpenAI 主张大语言模型训练属合理使用。DOJ 以国家安全和 AI 产业竞争力为主要论据,称训练使用具有转换性;《纽约时报》发言人批评政府站在 AI 公司一边牺牲创作者权益。法官要求双方最迟 9 月 4 日提交简易判决动议,该案结果可能为 AI 训练版
路透调查:多州整治虚报电力需求。
Article URL: https://antithetical-labs.com/blog/the-judge-liked-it-better/ Comments URL: https://news.ycombinator.com/item?id=49543771 Points: 2 # Comments: 0
美国军方平台加上 ChatGPT 与 Grok。
隐蔽任务和监控难度上升写进系统卡,Mythos 走受邀。
检测接口给监管、媒体、事实核查,不只内部。
Verge:模型「更努力」,账单不一定更低。
平台文档:能力、价格、思考块限制。
官方 prompting 指南,对着 5.1 改过。
新闻页与模型页互补,讲定价和开放范围。
企业扎堆给模型部署买安全,HiddenLayer 拿到 $100M。