ProximalHQ 发布 FrontierSWE v2 超长程编码基准,Claude Fable 5.1 大幅领先
ProximalHQ 发布 FrontierSWE v2 超长程编码基准,Claude Fable 5.1 大幅领先
X 热议
分类页是滚动库存,每页 24 条。首页只放当天精选。
ProximalHQ 发布 FrontierSWE v2 超长程编码基准,Claude Fable 5.1 大幅领先
很好奇 openai 发布的模型名称是如何命名的? @grok
Meta 发布 Muse Spark 1.3,为五个月内第四个 Muse Spark 版本。max 变体(合作伙伴限时预览)在 Artificial Analysis Intelligence Index 得 62 分。
Perplexity 开源本地推理引擎 Lily,专为 Apple Silicon 上的 Qwen3.6-35B-A3B 优化,用于支撑 Mac 应用新推出的混合计算功能,避免端侧算力成为 Computer 任务瓶颈。
测试了一下gemini 3.8flash在小作文方面的表现,同一个主题,gpt写的就好比流水账一般平铺直叙,换啥skill都救不了
Gemini 3.8 发布,作者称其表现非常亮眼。作者认为 Gemini 似乎在复制去年 2.5 Pro 到 3 的节奏,夏天后发力,到年底用 ultra 年票打折绑定用户,之后再拉半年。
Mostik 称其潜空间桥接协议让前沿模型与 4B 边缘模型直接传递 hidden states,无需文本、双方均不微调;753B 模型读题、4B 模型作答时达到前沿模型约 80% 的准确率、速度快 20 倍,且比分数匹配的中型模型少用 2.5 倍算力。
Meta 发布 Muse Spark 1.3,是五个月内第四个 Muse Spark 版本。xhigh 变体在 Artificial Analysis Intelligence Index 得 61 分。
Perplexity 宣布开源 Lily,这是其为 Perplexity Computer 的混合计算构建的本地推理引擎。Lily 专为 Apple silicon 上的 Qwen3.6-35B-A3B 优化,使设备端算力不会成为 Computer 任务的瓶颈。详情见 https://www.perplexity.ai/hub/blog/optimizing-on-device-inference-for-apple-silicon
Muse Spark 1.3 现已上线 OpenRouter,面向长时运行的智能体、多智能体和编码工作流。官方称其能记录所学内容、处理冲突输入,并在需要时请求澄清或确认,可通过 https://openrouter.ai/meta/muse-spark-1.3 使用。
Elvis Saravia 发推称,感觉我们正处在 RSI(递归自我改进)的早期阶段。他表示过去一个月情况发生了巨大变化,并问大家是否注意到近期模型发布的速度。
Meta 发布 Muse Spark 1.3,官方称比 1.2 减少 20% 工具调用和 25% token 用量。作者汇总基准数据:MRCR 256K-512K 得分 98.5,超过 GPT-5.6 Sol 的 91.5;JobBench 64.9、OSWorld 66.9、AutomationBench 49.4,接近 Opus 5 的 65.7、68.3、50.3。
Emad Mostaque 引用 ThePrimeagen 的观点,后者表示自己已有足够的智能,只希望模型更快更便宜,规模不再重要,需要的是性能。Mostaque 称这叫做 satisficing,并指出当模型速度快于人类引导它们的能力时,剩下的改进空间是什么。
Meta 官方宣布 Muse Spark 1.3 发布,已在 Meta 模型 API 和 Muse Code 上推出,官方称这是其在编码和智能体工作上的最大跃升,价格极低。
@synthwavedd 发布 Muse Spark 1.3,在 DeepSWE v1.1 长程智能体编程基准取得 75.4% 的 SoTA 成绩,超过 GPT 5.6 Sol 的 73.0 和 Opus 5 的 74.0。基准图还显示 MRCR 256K-512K 98.5、MRCR 512K-1M 98.1、Terminal-Bench 2.1 88.8,作者转发并感叹其超越 GPT 5.6 Sol 和 Fable 5。
Muse Spark 1.3 is rolling out today with frontier performance almost too cheap to meter. This is the…
作者 KIM 表示不想重新挑起争论,但非常希望明天就发布 Astra,并称自己用 Fable 5.1 已无法完成任何工作。配图显示 5-hour limit 已用满 100%,Weekly · all models 已用 53%,Weekly · Fable 已用满 100%,前者将在 4 小时 13 分后重置,周配额于周五下午 5:00 重置。
美团 LongCat 宣布 LongCat-2.0 已在 Command Code 上线并对所有订阅用户免费可用。该模型参数量 1.6T、上下文 1M、激活参数 48B,可通过 npm i -g command-code 安装使用。
Ethan Mollick 称自己获得 Gemini 3.8 Flash 早期访问,认为它是很好的 Flash 模型,但不等同于前沿模型。他用相同提示词让 Gemini 3.8 Flash 快速生成被淹没的新哥特式高塔 twigl shader,并附视频与 Fable 5.1 及此前模型的版本作对比。
美国司法部在 OpenAI 与纽约时报的版权诉讼中提交意见书,主张用受版权文本训练 LLM 一般应属合理使用,称模型训练具有非凡转换性,并以国家安全为由警告全面许可要求会削弱美国 AI 开发者竞争力。该意见书属建议性质、不约束法院,仍将数据获取方式与具体输出是否复制受保护段落作为独立问题留给法院逐案判断。
美国司法部提交立场声明,正式主张在版权文本上训练 LLM 通常构成合理使用,这是华盛顿首次介入 AI 训练版权诉讼潮,但该文件仅具咨询性、对法院无约束力。司法部区分了获取数据、训练和输出三个环节,认为训练用途不同于发表文章、不会替代原作;并警告一刀切的许可要求会抬高小公司门槛。法院仍需逐案裁定,但采纳该框架会把法律压力更多转向数据获取和具体输出环节。
Google 发布 Gemini 3.8 Flash 及新的 3.8 Flash Cyber,作者称后者推进网络防御前沿,这是 6 周内第 3 次 Flash 模型更新。
Yuchen Jin 分享 Fable 5.1 首日使用印象:说话更像正常人,不再有明显的 Claudish 味。他提到其网页搜索仍不如 GPT-5.6 Sol,常漏掉应搜的关键内容,但在前端方面仍明显强于 GPT 模型。他还表示自己的日常主力模型现在是 Kimi K3,称在 Databricks 内部大量实际使用,效果出乎意料地好。
TestingCatalog 转发 @mrfanduu 的探测结果,gpt-6-astra 这个模型标识已在 OpenAI API 中被检出为 GATED-EXISTS(404),而 gpt-5.7-astra、gpt-5.7 及 -sol/-luna/-terra/-cyber 变体均返回 400 不存在,gpt-5.6-cyber 对照组同为 404。作者称如果明天真的发布将是重要一周,并猜测 Routing 会先上线。