Pai 的 AI 雷达

今日必看

含近几日仍热话题,按时间衰减排序。今天先看 sickn33/agentic-awesome-skills,其次 TabularisDB/tabularis。并行还有 Value-Sensitive Delegation in Everyday AI Agent Use: Evidence from OpenClaw、How to Evaluate AI Agents From Tool Calls to Task Completion。

日期
2026/09/22
今日条目
491
#01

Value-Sensitive Delegation in Everyday AI Agent Use: Evidence from OpenClaw

arXiv:2609.22067v1 Announce Type: cross Abstract: Users increasingly delegate work to autonomous AI agents, yet evaluations typically measure task completion rather than the values users prioritize. Using Value Sensitive Design, we analyzed, with LLM assistance, 73,093 first-pers

推荐理由该研究可用于从价值敏感设计的视角分析真实用户在日常委托AI智能体时所重视的核心价值,帮助开发者超越单纯的结果达成指标,指导并优化更符合人类意图与价值观偏好的智能体委托评估与系统设计。
模型与评测arXiv cs.AI 官方
#02

How to Evaluate AI Agents From Tool Calls to Task Completion

When you ship an AI agent, the key question is whether it can execute a chain of work across dozens of sequential tool calls against a live environment, and recover when a step fails. Scoring whether the model sounds right tells you almost nothing about whether the work finished.

推荐理由该指南可用于评估AI智能体在真实运行环境中跨越数十次连续工具调用执行整套工作流程并在出错时自我恢复的能力,从而突破仅凭语言表达是否合理来打分的局限,切实检验工作是否真正达成与结束。
Agent与工具NVIDIA Developer GenAI
#03

A Unified Evaluation Framework for Trustworthy Large Language Models, Agentic AI, and Multimodal Systems

arXiv:2609.19524v2 Announce Type: replace Abstract: Benchmark scores alone provide an incomplete basis for assessing the trustworthiness of modern artificial intelligence systems. Large language models (LLMs), agentic systems, and multimodal models (MLLMs) require different forms

推荐理由该框架可用于统一评估大语言模型、智能体及多模态系统等现代AI系统的可信度,弥补单一基准测试得分无法完整衡量系统可靠性的缺陷,为不同架构形态提供更加全面且深度的可信度评估与安全验证。
模型与评测arXiv cs.AI 官方
#05

Refreshed repository pull requests page generally available

The new repository pull requests page is now generally available to all GitHub users. Highlights The new page makes it easier to find and act on pull requests in a repository, with new filtering and search options to help you find exactly what you’re looking for: Content assist h

推荐理由该全新上线的仓库拉取请求页面可用于更便捷地查找与处理代码库中的拉取请求,通过全新的过滤与搜索选项以及内容辅助功能,协助快速精准地定位所需内容并高效推进后续的处理行动。
产品接入GitHub Changelog
#06

GitHub Enterprise adds credential inventory exports

Enterprise owners can now export a complete inventory of every credential that can access their enterprise (e.g., SSH keys, classic and fine-grained personal access tokens, OAuth App access tokens, and GitHub App user-to-server and installation tokens). This enables enterprise ow

推荐理由该功能可用于完整导出能够访问企业的所有凭证资产清单,涵盖 SSH 密钥、经典与细粒度个人访问令牌、OAuth 应用访问令牌及 GitHub 应用令牌等,以此全面盘点并掌握可访问企业的所有凭据情况。
产品接入GitHub Changelog
#07

Advisory Group on Mathematics and Artificial Intelligence

OpenAI is working with an independent Advisory Group on Mathematics and Artificial Intelligence to guide the review and communication of emerging AI results.

推荐理由该数学与人工智能顾问团可用于为研究机构提供独立的专业指导,严格评估与审查新兴人工智能成果的准确性与科学价值,并指导这些前沿技术突破面向公众及学术界的规范沟通与公开传播。
产品接入OpenAI News
#09

AI 正在制造 App 过剩时代

你会为 App 付费吗? 在软件开发的起点已经变成了一句话生成的当下,我们发送诸如像「帮我做一个记账 App」的提示词,Codex 或者其它 Agent 就会自动完成编码、审查、测试、上线和发布等一系列流程。 原本那些因为不会编程、找不到开发者而搁置的想法,如今有了被做出来的机会。 AI 编程工具降低了做应用的门槛,但也把一个老问题更早地摆到了「开发者」面前: 做出来以后,谁会用? a16z 最新一期数据周报,给「vibe coding 创业潮」泼了一盆冷水:应用供给翻了四倍,需求却纹丝不动;独角兽确实在变年轻,但独立开发者的淘金梦,数据上一个都没有兑现

推荐理由这篇内容能用来帮助在 AI 浪潮下审视软件创业的商业可行性,看清供给暴增四倍而需求停滞的市场现状,提前预判产品研发后的用户获取与变现瓶颈,从而避免盲目跟风做应用而陷入无人买单的困境。
编码代理独立开发爱范儿
#11

通义千问发布 Qwen-Image-2.1:7B 单检查点同时支持图像生成与编辑

通义千问发布 Qwen-Image-2.1,一个 7B 参数的原生图像生成与编辑模型,生成和编辑共用单一检查点,最多支持 10 张参考图。模型自带提示词增强 LLM,已集成 diffusers 和 ComfyUI,并在 Hugging Face Spaces 提供免安装的浏览器在线 demo:https://huggingface.co/spaces/hugging-apps/qwen-image-2-1 🔗 阅读原文 via AIHOT · https://aihot.news/items/cmuao05at0q8uro5tpc85e2kj

推荐理由利用该模型可以通过单一检查点同时搞定图像生成与图片编辑,不仅能引入最多10张参考图进行辅助创作,还能依靠自带的LLM自动增强提示词,并直接接入diffusers、ComfyUI工作流或在浏览器中免安装在线出图。
创作成片AIHOT feed.xml
#12

一台主机,多重角色:新款 Mac mini 首发体验

Macmini虽然不是性能最强、体验最完整的Mac电脑,但在AI时代,它或许比以往任何时候都更适合家庭用户。从年初OpenClaw的现象级走红,到如今Codex引领Agent工作方式潮流,这台小巧精悍 ... 查看全文

推荐理由这台小巧精悍的新款 Mac mini 能够承担多重角色,在 AI 时代不仅可以作为家庭核心计算设备使用,还能紧跟技术潮流用来运行 OpenClaw 等热门应用,并支持体验由 Codex 所引领的全新 Agent 工作方式。
个人助理少数派
#13

mac-computer-use:让 AI Agent 深度操控 macOS 的增强工具集

📌 一句话摘要 mac-computer-use 为 AI Agent 提供一套可直接操作 macOS 的工具集,支持预演验证与智能前台交互,可无缝集成至 Claude Code 和 Cursor 等主流 AI 编程工具。 📝 详细摘要 mac-computer-use 是一套为 AI Agent 设计的 macOS 操控工具,支持窗口操作、输入、点击及截图。它不仅能作为 Skill 集成到 Claude Code、Codex、Cursor 和豆包等工具中,还引入了「预演-操作-验证」的闭环机制以减少错误。该工具在本地运行,无需密钥或外部服务,并具备智能

推荐理由它能作为技能无缝集成到 Claude Code 和 Cursor 等主流工具中,让 AI 在本地直接执行 macOS 的窗口控制、点击、输入与截图,并通过“预演-操作-验证”闭环机制与智能前台交互有效降低操作失误。
编码代理BestBlogs.dev
#14

AI 模型训练框架 Halo:提升吞吐量并降低微调成本

📌 一句话摘要 新发布的 Halo 框架原生支持 HuggingFace,吞吐量最高可达标准 TRL 的 2.8 倍,旨在降低专用模型微调成本并引入 Agent 范式文档设计。 📝 详细摘要 Halo 是一款支持 HuggingFace 原生格式的 AI 模型后训练框架。其核心优势在于极高的吞吐量(单卡最高约 2.4 万 token/s),可显著降低定制模型成本。此外,Halo 在设计上采用了 AI 原生思维,将文档分为人类阅读与 Agent 阅读版本,并内置了 Claude Code 等技能包,体现了向 Agent 范式的迁移。 💡 主要观点 显著提升

推荐理由Halo 能够直接基于 HuggingFace 原生格式进行高吞吐量、低成本的 AI 模型后训练与定制微调,不仅可以大幅降低专属模型的训练花销,还能借助内置的 Claude Code 技能包及专属 Agent 文档实现智能体协同开发。
编码代理BestBlogs.dev
#17

Cloudflare Python Workers are now generally available

Cloudflare Python Workers are now generally available After a two year preview, Cloudflare's support for running Python code in their server-side Workers platform is now stable: "Python is now a first-class, fully supported language on the Cloudflare Developer Platform". A neat t

推荐理由该功能可以用来在 Cloudflare 的服务端 Workers 平台上直接运行 Python 代码,作为开发者平台上一级且完全受支持的语言来稳定构建与执行服务端应用程序。
产品接入Simon Willison
#19

腾讯混元发布 Hy Image3.5 preview 图像生成模型

腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。

推荐理由该模型可用于根据文字描述或参考最多5张图片进行文生图与图生图,输出最高2K分辨率的高清图像,并支持通过多轮编辑对画面细节进行精细化调整,从而高效完成具有专业水准的高品质视觉内容创作。
创作成片AIHOT public items
#20

Runway wants to turn AI video generation into a live stream you control in real time

Runway wants to stream AI video as users prompt it, rather than make them wait for finished clips. The approach builds on GWM-1, its world model that generates video frame by frame. Beyond creative tools, Runway sees uses in robotics and autonomous driving. The article Runway wan

推荐理由该技术依托GWM-1逐帧生成的世界模型,能让用户在输入提示词时实时流式生成并操控AI视频而无需等待成片,不仅可以作为实时的创意工具,还能拓展应用于机器人以及自动驾驶等领域。
创作成片The Decoder
#21

How Warp ships 2,000 PRs a month with AI factories | Zach Lloyd (CEO, Warp)

Zach Lloyd is the co-founder and CEO of Warp, an AI-powered terminal and software factory platform used by tens of thousands of engineers. Before Warp, he spent nearly a decade at Google, including time as a principal engineer on Google Sheets. He built Warp from the ground up as

推荐理由可以通过这款由AI驱动的终端与软件工厂平台,将日常工程研发流程全面自动化,协助高效生成并交付每月数千个代码拉取请求,从而像运营现代化软件工厂一样大幅提升代码产出与团队迭代效率。
开发与开源创业者Lenny's Newsletter
#22

纽约时报诉讼文件披露:微软高管称 AI 抓取是人类历史上最大规模的劳动力盗用

纽约时报在起诉 OpenAI 和微软的版权案中提交法律简报并申请即决判决,引用双方内部文件称 AI 抓取是"人类历史上最大规模的劳动力盗用",OpenAI ChatGPT 负责人称其对出版商是"生存威胁"。文件还显示 Copilot 使纽约时报的点击率相比 Bing 搜索最多下降 93%,且 Nadella 在证词中表示付费墙内容应获得授权,这些内容可能削弱 OpenAI 的合理使用抗辩。

推荐理由这份材料可作为内容出版方在涉及生成式AI版权侵权的诉讼中反驳“合理使用”抗辩、主张付费授权的核心法律依据,也能用来量化评估AI抓取对媒体流量造成的生存冲击与经济损失,并为推动构建规范的AI数据授权合作机制提供关键谈判筹码。
开发与开源法律合规AIHOT public items
#23

19999 元起,启元机器人想把「个人机器人」先卖进普通人的生活

几乎所有的具身智能企业都在画饼:具身智能最终要进入人们的日常生活。 但具体什么时候进入人们的日常生活,你别管。 启元机器人相比于其他机器人或者具身智能企业的不同之处在于,网名为「稚晖君」的彭志辉可以为这家公司带来更多的 C 端曝光。彭志辉是智元创新的联合创始人兼 CTO,智元创新在去年收购了 A 股上市公司上纬新材,而上纬启元,即启元机器人则是上纬新材旗下的个人与家庭 C 端消费级机器人赛道的具身智能品牌。 ▲ 智元创新联合创始人兼 CTO 彭志辉 「把机器人卖给普通消费者」一直是一件听起来很有想象力、实际却相当困难的事情。 原因并不复杂。 一台工业机器

推荐理由作为定位在个人与家庭消费级赛道的具身智能产品,它能够作为个人机器人直接融入普通人的日常生活,承担家庭与个人生活场景中的智能化服务与交互,让具身智能真正从概念设想转变为可在日常生活中实际使用的实用工具。
开发与开源机器人具身爱范儿
#24

手机卷到头了,下一个让人忍不住掏钱的新物种,长这样

最近大模型领域好像没啥大新闻,唯一让大家兴奋的是 Jev 模型。 一个专为软件自动化决策设计的模型,不能聊天、不能写文章,只做决策。 研究几天,新鲜感很快消退。 不过细想,超快、超便宜的特性,感觉很适合自动驾驶和机器人? 说到机器人,我一个好友的终生梦想就是做机器人,尤其是养老机器人。 年纪大了,就让机器人照顾自己,让子女去追求自己的梦想,不拖累他们的生活。 他原以为做机器人这件事儿可以做一辈子,但由于 AI 突飞猛进,他觉得自己梦想设小了,哈哈哈。 果不其然。 今天,启元机器人在上海西岸梦中心·梦工厂举办「 我和我的个人机器人 」新品发布会,启元 Q1

推荐理由启元Q1个人机器人不仅可结合超快且低成本的自动化决策能力应用于智能辅助场景,更能在年老时提供贴身的养老照护与日常起居打理,在自己得到妥善照料的同时不拖累家庭,让子女可以放心去追求自己的梦想。
创作成片机器人具身乔木博客
#25

[AINews] Here are 6 Clones of Jev in 2 days

We covered Jev’s launch on Wednesday , and they have completely taken over the timeline, with 36M views of their launch video (by comparison, OpenAI’s Navier Stokes result got 74M views, and Anthropic’s Fable 5 got 57M views) in just two days. @typesafeai reached ~13% of teams, 2

推荐理由它可用于快速复现与深入研究上线仅两天便收获数千万播放的现象级AI项目Jev,通过直接对比参考多种开源复刻实现,高效掌握其核心机制并加速同类应用的开发落地。
创作成片Latent Space
#26

美军因 AI 幻觉情报报告险些拦截中国船只

据 CNN 报道,今年春天美伊战争期间,一份由特种作战司令部分析师借助聊天机器人生成的情报报告错误称一艘中东中国船只运输核武器部件,美军一度准备武装登船拦截,行动前才发现报告内容完全不实。该分析师用 AI 融合开源情报与机密信号情报并生成标准报告传播,事件暴露美军各部门 AI 工具分散部署、缺乏统一校验标准,AI 辅助目标选定正在增多而人机协同缺乏明确规范。

推荐理由该案例可作为研究与宣讲军事人工智能安全的典型警示素材,用于论证AI情报分析中“幻觉”可能引发的严重地缘冲突与军事误判风险,并为防务部门建立跨机构AI审查标准、完善人机协同验证机制提供实证参考。
开发与开源机器人具身AIHOT public items
#27

Good luck slowing this down

Hi folks, How tf do I write an intro to the craziness that’s happened since the end of last week?! I got access to Instinct, the personal agent all the VCs are raving about - I think it’s a bit meh? I don’t know if it’s the pro-activeness that people seem to like, but I don’t lov

推荐理由这款备受风险投资机构热捧的主动型个人代理 Instinct,可以凭借其主动性协助用户处理日常生活与工作事务,同时也能够用来帮助人们基于真实上手体验客观评估当前热门 AI 助理的实际表现。
个人助理Ben's Bites