Pai 的 AI 雷达

今日必看

今天的简报把可直接接入工作流的工具、推理评测与模型和平台更新放在一起:一端是 ComfyUI 节点管理、MCP SDK、推理压测以及本地和多智能体工具,另一端是 Copilot、实时同传、代码审查与开发平台变化。阅读时可先按能否装进现有流程筛选,再看模型和平台的时间约束,最后把研究与案例当作可复用的评测或部署线索。

日期
2026/09/19
今日条目
491
#01

AIPerf 评测大规模 LLM 推理

You’re deploying a model on a system. It starts up, prompts are getting responses. Now the hard question: Is this fast? Your instincts might lead you to send curl commands, hand-roll an asyncio script, or vibe code yet another one-off load generator. All of these paths have the s

推荐理由AIPerf 可以在大语言模型部署上线后作为专业的基准评测工具,替代简陋的手写压测脚本与临时请求,通过生成标准化的负载精准测量大模型的推理响应速度、吞吐能力及并发承载力,从而科学量化系统的实际运行效率。
模型与评测NVIDIA Developer GenAI
#02

Copilot 部分模型将于 10 月 19 日弃用

We will deprecate the following models across all GitHub Copilot experiences (including Copilot Chat, inline edits, ask and agent modes, and code completions) on October 19th, 2026: Model Deprecation date Suggested alternative Gemini 3.7 Flash 2026-10-19 Gemini 3.8 Flash GPT-5.5

推荐理由该通知能用来获悉 GitHub Copilot 全场景的模型下线与替换计划,帮助提前知晓代码补全、聊天及智能体等模式中 Gemini 3.7 Flash 的弃用时间,以便平滑切换至推荐的 Gemini 3.8 Flash 或 GPT-5.5 替代方案,保障日常编码辅助与自动生成工作持续稳定运行。
Agent与工具GitHub Changelog
#03

Copilot 代码审查体验升级

Copilot code review now gives you a clearer view of how a review changes over time, more intelligently auto-resolves its own suggestions, and generates useful commit messages when you accept eligible suggestions in a batch. These updates help you focus on findings that still need

推荐理由你可以用它更清晰地追踪代码审查随时间的变化历程,借助智能自动解决自身建议并在批量采纳时自动生成提交信息,从而将更多精力高效聚焦在真正亟待处理的代码审查问题上。
开发与开源GitHub Changelog
#04

Qwen3.8-LiveTranslate 同传延迟降至 2.3 秒

Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker-Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。

推荐理由该模型可依托低至2.3秒的超低滞后时间与全新Thinker-Talker架构,在跨国视频会议、国际峰会演讲、跨境赛事直播及跨语言对话交流中提供更连贯、近乎实时的多语种同声传译与实时字幕生成服务。
模型与评测AIHOT public items
#07

Google AI 与经济团队引入新专家

We are expanding our AI & Economy team with world-class academic advisors, fellows, and core internal researchers.

推荐理由该举措可用于依托世界级学术顾问、访问学者及核心研究员的专业能力,深入研究人工智能对全球经济发展、就业结构与生产力变革的深远影响,从而为把握前沿技术走向、制定合理的产业经济策略与公共政策提供高水平的智力支持与决策依据。
产品接入Google AI
#10

金融科技用专用推理扩展编程代理

Inside a global bank's shift to self-serve dedicated inference: how Together's DMI gave engineering teams direct control over scaling, models, and testing.

推荐理由该方案可用于让工程团队自主掌控专用推理资源,直接管理大模型的弹性扩缩容、模型选型与系统测试,从而高效扩展编程代理能力,加速金融科技业务中的代码生成与智能化研发流程。
编码代理金融Together AI
#11

Quoting Thariq Shihipar

We're adding support for AGENTS.md to Claude Code. Starting today in version 2.1.277, if there is no CLAUDE.md in a folder, Claude will check for and use AGENTS.md. AGENTS.md support is built off of Claude Code mods, our upcoming way to customize the Claude Code harness. This is

推荐理由这项特性能在目录中未发现 CLAUDE.md 时让 Claude Code 自动检查并采用 AGENTS.md,同时依托即将推出的 Claude Code mods 机制,为自定义与定制该工具的底层运行框架提供支持。
编码代理Simon Willison
#12

capcut-cli:让 Agent 在终端操作剪映草稿的开源命令行工具

📌 一句话摘要 capcut-cli 是一个非官方剪映命令行工具,支持读写本地草稿、自动切除静音、Whisper 生成字幕、多语言克隆等功能,可接入 AI Agent 或自动化平台批量处理视频。 📝 详细摘要 推文介绍 capcut-cli:非官方剪映 CLI,可读写本地草稿文件,Agent 改完后打开剪映轨道仍可手动调。支持自动切除静音、Whisper 带样式字幕、长视频切短视频(场景/静音/口误检测)、SRT 字幕导入导出、一键多语言克隆、抠像/绿幕/变速/转场/模板等。完全本地运行,不上传数据,原地写回并备份,可作为库调用或接入 n8n、Coze

推荐理由它能直接在终端读写剪映本地草稿并自动备份,实现静音切除、Whisper生成带样式字幕、长视频智能切短、多语言克隆以及抠像、变速与转场等特效处理,不仅改完后可回剪映手动微调,还能作为库或接入自动化平台批量全流程处理视频且全程本地运行不泄露数据。
Agent与工具BestBlogs.dev
#15

Meta 发布 Muse for Mac,个人智能体可直接在电脑上执行任务

Meta 官宣 Muse for Mac 即日起推出,个人智能体可在用户明确授权下直接在电脑上完成任务。能力包括整理下载文件夹、查找丢失的文件、总结消息和笔记,官方表示更多功能即将推出,下载地址 http://ai.meta.com/muse/download/。 🔗 阅读原文 via AIHOT · https://aihot.news/items/cmu63zp9f09xsrofjmnxvrwdg

推荐理由作为直接运行在电脑上的个人智能体,Muse for Mac 能在获得明确授权后帮你自动整理下载文件夹、快速搜索查找丢失的文件,并提炼总结聊天消息与各类笔记内容,协助处理日常电脑事务。
Agent与工具AIHOT feed.xml
#16

Dynamically Scaled Activation Steering

Activation steering has emerged as a powerful method for guiding the behavior of generative models towards desired outcomes such as toxicity mitigation. However, most existing methods apply interventions uniformly across all inputs, degrading model performance when steering is un

推荐理由该技术可用于动态引导生成式模型的输出表现以减轻有害内容生成,并通过动态调整干预力度避免因对所有输入统一施加干预而损伤模型在无需干预时的原有性能。
模型与评测Apple ML Research
#17

How to call vibecoding when we know what we are doing?

So, anyone can vibe code, butt how do you call it when someone who knows what they’re doing is using ai to code? Like, I have more than 10 years of coding; of course I am “vibe coding” using Claude’s to write everything for me… but I do not see it as me and some other ne who neve

推荐理由该话题可用于探讨专业开发者如何结合多年工程经验与代码生成工具提升效能,帮助行业厘清经验主导的架构级开发与盲目随性编码的本质界限,并为经验驱动的人工智能协同开发模式确立更准确的定义与交流共识。
编码代理Anthropic Watch 非官方
#18

复盘 Jev 发布前演讲:从‘取悦人类是幻觉根源’到‘智能接口软件可依赖’的完整产品逻辑

📌 一句话摘要 作者将一个月前 TypeSafe CEO 在 AI Engineer 大会的演讲与 Jev 正式发布对照,揭示其产品哲学全链条:不生成字符串根治幻觉、校准决策替代 RLHF、结构化 API 重造交互、瞄准‘智能 if 语句’市场、Jevons 悖论定价策略。 📝 详细摘要 推文逐条拆解演讲与产品的七大对应关系:1)奖励模型不对称性导致模型假装自信→ Jev 根本不生成自由文本,输出类型化决策+认识论诚实概率;2)‘模型 95% 对且能说出那 5%’→ 开发者设阈值自主/上报,人从纠错者变开关;3)Claude Code 仍是 RLHF 辅

推荐理由它可以作为软件开发中的“智能if语句”,通过直接输出类型化决策与诚实概率来根除自由文本引发的幻觉,让开发者依据置信阈值实现业务逻辑的自主执行与异常上报,将大模型安全、可靠地嵌入到确定性的代码架构与核心系统之中。
编码代理BestBlogs.dev
#19

how do u guys manage multiple agents + tasks at once?

pretty new to vibe coding so maybe i’m missing something obvius when u guys have multiple agents running at the same time, how do you actually manag everything? like if u have 3 or 4 terminals working on different tasks, how do u keep track of what each one is doing, what’s finis

推荐理由它能用于集中监控并协调在多个终端中并行运行的各种智能体,实时追踪各个窗口的代码生成进度与当前状态,清晰掌握各项工作究竟是在执行还是已经完毕,从而在多路并发协作时轻松掌控整体开发节奏。
编码代理Anthropic Watch 非官方
#20

The Overhang

We are still on an exponential curve of AI development. I try to put out a Substack post every couple weeks or so, yet, as the pace speeds up, that sometimes feels too slow. In the weeks since my last post, we had the apparent cracking of one of the most famous problems in math b

推荐理由这篇文章可以用来紧随处于指数级加速曲线中的人工智能前沿动态,及时追踪并深入了解在短短数周内接连涌现的重大突破,例如著名数学难题疑似被破解等最新科技成果。
创作成片One Useful Thing
#21

美军因 AI 幻觉情报报告险些拦截中国船只

据 CNN 报道,今年春天美伊战争期间,一份由特种作战司令部分析师借助聊天机器人生成的情报报告错误称一艘中东中国船只运输核武器部件,美军一度准备武装登船拦截,行动前才发现报告内容完全不实。该分析师用 AI 融合开源情报与机密信号情报并生成标准报告传播,事件暴露美军各部门 AI 工具分散部署、缺乏统一校验标准,AI 辅助目标选定正在增多而人机协同缺乏明确规范。

推荐理由该案例可作为研究与宣讲军事人工智能安全的典型警示素材,用于论证AI情报分析中“幻觉”可能引发的严重地缘冲突与军事误判风险,并为防务部门建立跨机构AI审查标准、完善人机协同验证机制提供实证参考。
开发与开源机器人具身AIHOT public items
#22

[AINews] not much happened today

if you see this, it’s because you’re a real fan. AI News for 9/16/2026-9/17/2026. We checked 12 subreddits, 544 Twitters and no further Discords. AINews’ website lets you search all past issues. As a reminder, AINews is now a section of Latent Space . You can opt in/out of email

推荐理由这份资讯能帮你一站式获取汇总自十余个社区版块与五百多个推特账号的最新人工智能动态,不仅支持在官网检索所有往期历史内容,还能通过自由订阅或退订邮件来持续跟进前沿进展。
创作成片Latent Space
#23

OpenAI reportedly closes in on solving the Hodge conjecture, its second Millennium Prize Problem

OpenAI is reportedly tackling the next Millennium Prize Problem. After its still unconfirmed solution to the Navier-Stokes problem, the company is now working on the Hodge conjecture. Employees expect a solution soon, but any announcement could be delayed. After the PR crisis aro

推荐理由该内容可用于深入追踪和评估前沿人工智能在攻克千禧年大奖难题等极端复杂数学领域的推理极限,并为分析大模型向代数几何与尖端科学研究深度赋能的应用前景提供关键参考。
创作成片The Decoder
#24

派早报:欧盟拟禁止 13 岁以下儿童使用社交媒体等

少数派的近期动态口袋先知新版本1.3.3上线,你可以自定义任何你想展示的屏幕效果。了解更多能让AI助手通过自然语言指令直接与您的Quote/0摘录墨水屏交互的DotSkill已上线。点击了解八月买了什 ... 查看全文

推荐理由你可以利用新版口袋先知自由自定义想要呈现的屏幕视觉效果,并通过全新上线的技能让AI助手直接以自然语言指令与Quote/0摘录墨水屏交互联动,实时展示与管理各类个性化内容。
开发与开源硬件边缘少数派
#25

用 Seedance 2.5 拍《沙丘 3》,我们替你把 AI 短片的坑全都踩过了

 看到这条视频,你会不会以为《沙丘 3》提前泄露了。 这其实是一部由我们团队的两位同事,花 12 天时间,结合 Codex 和 Seedance 2.5 完成的 AI 短片。 制作过程比我们预想中要复杂,整部片子只有 6 分钟,制作过程累计消耗了 3000 多元的积分额度。更重要的是,它并不是靠一句提示词「一键生成」出来的。 从剧本、角色、服装和场景,到逐镜生成、反复筛选和后期剪辑,我们几乎把一套微型剧组的工作,在电脑里重新走了一遍。 图|如果不看制作过程,你能分辨出这是 AI 生成的画面吗? 今天这篇图文,我们就来把整套流程拆开讲清楚,也会分享其中最

推荐理由这篇图文能用来指导如何结合AI工具在电脑上跑通一套微型剧组的工作流,提供从剧本构思、角色场景设定到逐镜生成、筛选与后期剪辑的完整实操经验,帮助避开高昂的积分额度与时间试错成本,实现高质感电影级短片的制作落地。
创作成片爱范儿
#26

Claude Code relaunches Projects to manage multiple AI agents in the cloud

The revamped projects feature in Claude Code allows users to run multiple agents under the same roof, with a shared memory, goals, and library of files and artifacts. Similar to Grok Bot and other tools that manage groups of AI agents, each project has "threads" running different

推荐理由它可以让用户在云端统一管理并运行多个 AI 智能体,通过多线程并行开展工作,并让所有智能体共享相同的记忆、目标以及文件与制品库,从而实现高效的多智能体协同作业。
个人助理The Verge AI
#27

Last Week in AI #344 - Navier–Stokes, Pacing the Frontier, AI Misuse

Top News OpenAI Says It Has Cracked One of Math’s ‘Millennium Problems’ Related: On the Navier–Stokes Millennium Prize Problem Quartz: OpenAI cracks the Navier–Stokes Millennium Prize problem OpenAI fought dirty on career-making math problem, says NYU mathematician OpenAI’s feud

推荐理由这份内容可用于快速了解OpenAI声称破解纳维-斯托克斯千禧年数学大奖难题的最新进展,深入探究该成果伴随的学术界争端与争议内幕,以此洞察前沿AI在顶级科学探索中的实际应用与深远影响。
创作成片Last Week in AI
#28

纽约时报诉 OpenAI 与微软案解封文件披露 AI 抓取被称为史上最大劳动窃取

纽约时报诉 OpenAI 与微软版权案的新解封文件披露,微软高管 Brent Hecht 在内部备忘录中称 AI 抓取是"人类历史上最大规模的劳动窃取",OpenAI 高管 Nick Turley 则称聊天机器人对出版商构成"生存威胁"。

推荐理由这份披露微软与OpenAI高管内部定性的解封文件,可作为版权诉讼中追究科技巨头侵权责任的核心法庭证据,并能在立法研讨与行业谈判中,用于有力佐证AI无偿抓取对出版业构成的生存威胁与劳动剥削,从而推动建立合法的数据授权与创作者补偿机制。
开发与开源机器人具身AIHOT public items
#30

Muse review: The personal AI agent that gets consumer UX right

I spent a few hours putting Meta’s Muse, its new personal AI agent, through a real first-pass test: onboarding, calendar management, goal setting, a one-shot family morning newsletter, browser-based shopping, and the animated avatar that honestly surprised me. Listen or watch on

推荐理由Meta 推出的个人 AI 助手 Muse 可用于管理日常日历日程、规划并跟踪目标、一键生成家庭晨间快讯简报、在浏览器端协助网购,还能通过生动的动画虚拟形象完成使用引导与智能交互。
个人助理Lenny's Newsletter
#31

4-bit Rotational Quantization

4-bit Rotational Quantization in Weaviate 1.39: the SIMD performance work, a centered tier, scaling analysis and a TurboQuant comparison.

推荐理由这项技术可用于在Weaviate向量数据库中对高维向量进行4位极致压缩与旋转量化,依托SIMD硬件指令加速与居中层级优化,在大幅削减内存占用和存储成本的同时,显著提升大规模向量检索的查询性能与扩展能力。
开发与开源Weaviate Blog (Olshansk)
#32

Good luck slowing this down

Hi folks, How tf do I write an intro to the craziness that’s happened since the end of last week?! I got access to Instinct, the personal agent all the VCs are raving about - I think it’s a bit meh? I don’t know if it’s the pro-activeness that people seem to like, but I don’t lov

推荐理由这款备受风险投资机构热捧的主动型个人代理 Instinct,可以凭借其主动性协助用户处理日常生活与工作事务,同时也能够用来帮助人们基于真实上手体验客观评估当前热门 AI 助理的实际表现。
个人助理Ben's Bites