Gemini 3.8 Flash + Flash Cyber
六周内第三次 Flash:工作马 3.8 Flash 走编码/Agent,Cyber 走漏洞发现与补丁。入门价 $0.75/$3.75,年底翻倍。API、AI Studio、Gemini 应用可用。
Pai 的 AI 雷达
今天:Gemini 3.8 Flash(Agent 原型),Muse Spark 1.3。并行还有 Qwen3.8-Max-0902 快照、Path to Astra、Claude Fable 5.1。
六周内第三次 Flash:工作马 3.8 Flash 走编码/Agent,Cyber 走漏洞发现与补丁。入门价 $0.75/$3.75,年底翻倍。API、AI Studio、Gemini 应用可用。
官方模型页:四月以来第四个 Spark 检查点,Muse Code 和 Meta Model API 可用。相对 1.2 更省 token 和工具调用。
阿里云文档 9 月 2 日更新:2.4T MoE 后训练快照,强化工程级编码和多工具协作,1M 上下文。新加坡标价 $2/$6。
Astra 是 OpenAI 首个 Preparedness Critical 档:带工具可自行找未知漏洞并做利用链。部分研发推迟,网安能力先给测试再给 Daybreak Blue。
同一底座两套护栏。Fable 5.1 公开(1M 上下文,$10/$50),Mythos 5.1 仅受邀,走 Project Glasswing 做网安和生命科学。
NVIDIA 系列第三篇:怎么训/选 draft 模型和校验设置,加速 decode 还不掉点。
用心理测量看常见 LLM 评测是不是在测同一潜变量。别把榜上 0.5 分当成能力跃迁。
Google 发布当天插件跟上:gemini-3.8-flash,低/中/高 thinking,修了异步日志。
2609.02886,今日 HF daily 最高票(32)。开源数据和可扩展训练配方。
HN 头版长文:语言模型在跳,本体仍卡在数据、接触、可靠性。给 TwinDEX 当背景读。
2609.02783:完整跑一遍前沿 Agent 基准太贵,用早期轨迹预测最终成败来省钱。
2609.02737:模型实际只盯上下文一小截,却仍扫整份 KV。让模型决定听哪些 token。
医疗机构把可信病历和行业数据接到 ChatGPT,在既有治理下查患者上下文,而不是往对话框贴病历。
The performance of LLM-based agents is jointly shaped by the base model and the harness used when interacting with the environment. This exposes them to safety risks in both harmfu
Harnessing naturally occurring feedback from user interactions offers a promising learning signal for Large Language Models (LLMs). However, recent studies suggest this feedback is
真机部署评测,不停留在仿真分。
Google AI 讲评测量表,避免法官模型胡打分。
企业默认模型不再锁死一家。
App 和 CLI 都可排除路径,不送进模型。
官方 prompting 指南,对着 5.1 改过。
改对话再复用 thinking block 会报错。
DeepMind 博客版,和 Google 产品博客同一发布。
平台文档:能力、价格、思考块限制。
Root cause analysis (RCA) is a critical task in telecom network operations, but diagnosing performance degradations in modern 5G and emerging 6G networks remains challenging due to