AI Radar 0826:OpenAI 一天四篇 GPT-5.6 落地账本;Jalapeño 首测挂公开榜;技能包开始带安全扫描
AI Radar 2026-08-26:OpenAI 一天四篇 GPT-5.6 落地账本,自研芯片 Jalapeño 首测挂公开榜,技能包开始带 CI 与安全扫描。
系列:AI Radar
今日导览
OpenAI 一天连发四篇 GPT-5.6 落地案例;自研芯片 Jalapeño 首测挂上公开 benchmark;一个科学技能库给 agent 装了 163 个技能;“先不上向量库” 的 RAG 文章在 HN 拿了 122 分。
开源观察
一个技能库给 agent 装上 163 个科学技能,兼容五家宿主
scientific-agent-skills 收录 163 个经过验证的科研技能与 78+ 数据库的 查询能力,同一个包可被 Cursor、Claude Code、Codex 等兼容 Agent Skills 标准的宿主直接安装。仓库给每个带脚本的技能配了 CI 测试,并每周跑一次 安全扫描。“装技能之前先审一遍”已经从建议写成了 README 的正式章节。
标签:#agent技能 #开源 #供应链安全 GitHub
一个只做架构图的技能冲上 Trending
archify 把系统描述或代码库变成可交互的技术地图。它不直接出图:先生成 一份带类型的 JSON 中间层,过一遍确定性检查,再渲染成自包含 HTML—— 架构改动前后差了几根连线,能逐条列出来。agent 产出物能不能机器校验, 正在变成比“像不像人画的”更靠前的卖点。
标签:#agent技能 #架构可视化 #可验证 GitHub
聚合各家免费额度的 CLI 日增千星
free-claude-code 把 50 个提供商的免费/付费/订阅/本地模型装进一个终端 工具,README 自称每月 1.3B+ token 可用且“ToS friendly”,独立开源、 声明与 Anthropic 无关联。它火说明 token 成本焦虑是真实的;至于 “ToS friendly”,那是作者的自我声明——聚合免费层历来是平台最先堵的 口子。
标签:#AI工具 #token成本 GitHub
一篇文章主张 RAG 没那么多人想的那么复杂
作者给了张升级阶梯:60% 的系统用 BM25 加查询重写就够,剩下的按数据 新鲜度和查询量逐级再加向量库。这跟几个坚持本地词法排序的知识库项目 说的是同一件事:先不上向量库,正在成为一部分人的默认答案。
标签:#RAG #检索 #工程实践 Lighthouse Newsletter(HN 122 分 · 49 评论)
媒体资讯
OpenAI 一天四篇官博,全是 GPT-5.6 的落地账本
Kiro 集成(Terminal-Bench 2.1 上任务成本降约 82%)、Replit 免费模式、 开发者指南,外加一个 Asana 案例:四个 agent 各拿一份代码库副本并行, 1.5 周清掉一个拖了五年的测试系统,花了约 $12K——原人力方案估价 $6M。报道里最实的一个细节:工程师每天早晚两次检查、逐个 review 改动。人没出回路,只是换了位置。
标签:#OpenAI #GPT-5.6 #agent #落地案例 Kiro 集成|Asana 案例
OpenAI 自研芯片 Jalapeño 首测对标 NVIDIA 现役旗舰
公开 InferenceX 基准下,对 GB200/GB300 每瓦性能 1.5–1.9 倍、端到端 延迟低 1.7–3.6 倍,年底前开始部署。自研芯片的第一次亮相没有发跑分 海报,而是把数据挂上了公开榜单。
标签:#OpenAI #芯片 #推理基础设施 OpenAI 官博
一篇文章给 AI 记忆栈补了“推理账本”这一层
它的主张:记忆保存“是什么”,推理保存“为什么”。多数系统优化检索, 却很少记录“这个决策当时依据了什么”——该记的是可观察的决策环境 (证据、工具、审批、策略版本),不是模型的私有思维链。这跟工程界的 ADR 和审计日志是同族的东西。
标签:#AI记忆 #决策留痕 #agent架构 DEV.to
来源与口径:采集自 Trending Digest 插件(HN / GitHub Trending / OpenAI Blog / DEV.to),本期条目逐条复核过原始链接后才收录;榜单与 热度数字为采集时刻页面值。
关联
derived-from→ 当日 Trending Digest 采集文件:本期由其采集结果经策展核实而成。
原始来源:https://openai.com/index/jalapeno-first-results(在新窗口打开)