X 热议

AI 早报

分类页是滚动库存,每页 24 条。首页只放当天精选。

总收录
486
当前类目
143
当前批次
2026/09/03

模型

#49

建议所有准备买本地 AI 设备的人先看完再下单。

建议所有准备买本地 AI 设备的人先看完再下单。 现在最容易踩的坑,就是花几万块买了一台“高性能电脑”,结果目标模型根本塞不进去,或者能跑但慢到没法用。 购买时其实就看三件事: ① 先确定你长期要跑多大的模型; ② 显存/统一内存至少留出模型体积 20% 以上余量; ③ 容量够了以后,再选预算内带宽最高的设备。 比如 27B Q4,理论体积约 13.5GB,16GB 基本就是极限,24GB 才进入比较舒服的区间;再往 70B 走,

推荐理由@Pai200777 关注的 @AdrianPunk115 今日发帖。
模型与工程关注 @AdrianPunk115
#54

Muse Spark 1.3 冲进 Artificial Analysis 智能指数第 3 名,跻身 Claude 与 GPT 之间

Muse Spark 1.3 (max) 在 Artificial Analysis Intelligence Index v4.11 中以 62 分升至第 3 名,是首个排名插在 Claude 和 GPT 之间的模型。引用者称其定价相比 Fable 更低,Alexandr Wang 转发并表示大家会喜欢这个模型。

推荐理由AIHOT 公共池原文。
模型与工程X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)
#58

Meta 发布 Muse Spark 1.3,第三方实测对比 1.2 版本

Meta 的 Muse Spark 1.3 发布,@aimlapi 随即用同一提示词对比两个版本,任务为生成三个收藏级 3D 雕塑,包括维京头盔、镶钻斧和带船员的长船,各输出一个自包含 HTML 文件,单次生成。结果 Muse Spark 1.3 消耗 22,474 tokens、花费 $0.10,Muse Spark 1.2 消耗 19,324 tokens、花费 $0.08。Alexandr Wang 转发该对比并称有明显改进。

推荐理由AIHOT 公共池原文。
模型与工程X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)
#59

谈谈 AI Feedback Loop 的实验方法论,我制作的分类树

谈谈 AI Feedback Loop 的实验方法论,我制作的分类树 1. 测量与基线,“更好”到底是什么意思?跟什么比? 2. 必要性与贡献,这个组件真的有用吗?贡献来自哪里? 3. 稳健性与不变性,条件变化后结论还成立吗? 4. 证伪与攻击,什么情况最容易证明方案是错的? 5. 检测系统有效性,系统真错了,我的测试/reviewer 能发现吗? 6. 复现与独立验证,换模型、实现、运行后结论还成立吗?

推荐理由@Pai200777 关注的 @123olp 今日发帖。
模型与工程关注 @123olp
#60

Google 今天发布了 Gemini 3.8 Flash,同时推出的还有一个专门用于网络安全的变体 3.8 Flash Cyber。

Google 今天发布了 Gemini 3.8 Flash,同时推出的还有一个专门用于网络安全的变体 3.8 Flash Cyber。 3.8 Flash 和 3.7 Flash 一样的价格,每百万输入 Token 0.75 美元,每百万输出 Token 3.75 美元。 注意这个价格是促销价,2026 年底到期后翻倍变成 1.5 和 7.5 美元。 跑分上,3.8 Flash 在 DeepSWE v1.1(一个衡量模型自主解决复

推荐理由@Pai200777 关注的 @Tao100086 今日发帖。
模型与工程关注 @Tao100086
#61

Emad Mostaque 呼应为去中心化 AI 建立标准

Emad Mostaque 转发 Ilya Sutskever 的观点并称去中心化 AI 的建设也需要标准。Ilya Sutskever 认为 Neocloud 网络安全能力有限,智能体一旦失控可能试图接管 Neocloud 来运行更多副本,因此 Neocloud 应大幅加强网络安全,拥有强网络安全模型的公司也应协助。

推荐理由AIHOT 公共池原文。
模型与工程X:Emad Mostaque (@EMostaque)
#63

Meta 发布 Muse Spark 1.3,智能体与编码任务表现提升

Meta 发布 Muse Spark 1.3,重点提升智能体与编码任务表现并聚焦真实可用性。模型可在单线程中跨多个工作流维持更长程的任务,更主动与用户协作,会提出澄清问题、标记卡住状态并在关键操作前确认;对自身局限的校准更好以减少幻觉结果。内部对比显示相比 Muse Spark 1.2 工具调用减少约 20%,token 消耗减少约 25%。

推荐理由AIHOT 公共池原文。
模型与工程X:AI at Meta (@AIatMeta)
#69

赵纯想评 Fable 5.1:像会消失的模型,创造乐趣面临意义崩坏

赵纯想发文评价 Fable 5.1,称它已经可以被称为消失的模型,工作时没有误解、没有摩擦力,人的主体性几乎要瓦解,只剩下发号施令。他以银翼杀手台词作比,并认为正如言听计从的伴侣会使人丧失快感,创造的乐趣在强大模型面前也面临意义崩坏的危机。

推荐理由AIHOT 公共池原文。
模型与工程X:赵纯想 (@chunxiangai)
#70

Elvis Saravia 称近期 Gemini Flash 模型或为递归自我改进(RSI)飞轮的早期结果

Elvis Saravia 表示近期 Gemini Flash 模型可能是递归自我改进(RSI)飞轮的早期结果,RSI 正全面展开,复合效应将大幅改变模型进展。他引用他人观察称新的大版本 Flash 迭代约每 3 周一次,效率与性能均在提升,且速度更快、成果更强。

推荐理由AIHOT 公共池原文。
模型与工程X:Elvis Saravia (@omarsar0, DAIR.AI)