OpenAI 发布 GPT-6,ChatGPT 改用图表、按钮和小工具的交互界面
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,模型不再以纯文本作答,而是用图形、按钮、图表和表单等交互界面呈现答案,格式会随问题自动调整,用户还能在对话内生成储蓄计算器、小游戏等小工具。
推荐理由:GPT-6 把 ChatGPT 输出从纯文本改为交互界面,并给出等待时间与内测搜索表现,可据此判断对话产品形态的变化方向。
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,模型不再以纯文本作答,而是用图形、按钮、图表和表单等交互界面呈现答案,格式会随问题自动调整,用户还能在对话内生成储蓄计算器、小游戏等小工具。
推荐理由:GPT-6 把 ChatGPT 输出从纯文本改为交互界面,并给出等待时间与内测搜索表现,可据此判断对话产品形态的变化方向。
Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建了多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,缩短 78%。该系统还把手动生命周期操作从 10 多个步骤压缩为 1 次交互,并将冗余告警中位数减少 65%,由三人团队在六个月内交付。
Meta 周三宣布其 Muse 助手推出独立 iPad 应用,距 9 月 8 日在 iOS 和 Android 上线仅一个月。据 Sensor Tower 估算,Muse 上线以来安装量已超过 660 万次。
Nous Research 以 15 亿美元估值完成 9000 万美元 B 轮融资,由 Robot Ventures 领投,Nvidia、Union Square Ventures、Menlo Ventures、Samsung 等参投,公司累计融资达 1.58 亿美元。
Cal AI 联合创始人 Zach Yadegari 为其 AI 智能体新公司 Persona 完成 1000 万美元融资,由 Vine Ventures 领投。
Goodfire 发布一类新型 AI 监控器,通过读取模型内部激活信号而非重读输出,来发现失控的 AI 智能体,目前已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 100 万次交互成本约 185 美元,而用较便宜的 AI 模型逐步检查需 5420 美元,顶级模型则约 20 万美元。
AI 与硬件初创公司 Natura 发布 99 美元智能戒指 Interface,按下手指即可让 AI 智能体完成任务、记录想法,无需掏出手机。
OpenAI 在 ChatGPT 中推出 Intelligent UI 功能,让回答可以结合图表、表单、可点击按钮等交互式视觉内容。OpenAI 表示训练了 GPT-6 判断何时生成交互视觉而非纯文本,以及如何在回答中排版,示例包括七速自行车结构图、麻将教学图和退休储蓄计算器等内联工具。
Anthropic 为 Claude 推出两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。
AWS 介绍 Amazon Bedrock AgentCore payments 已正式可用,为 AI 智能体提供按需付费的托管能力,由基础设施层而非模型执行支出限额。
Google 在 Google Cloud 活动上宣布为 Gemini 引入统一智能体,可回答问题并代为完成任务,初期面向企业客户,之后再推向消费者。该智能体可接收目标而非仅指令,自行规划工作、调用自定义技能与工具,并连接 Google Workspace、Microsoft 365、Slack、Jira、Git 等内部系统,也支持通过 MCP 服务器安全接入。
Oracle 在招聘、工程和运营场景中,用 ChatGPT Work 和 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作缩短到几分钟。
Google 在 Gemini at Work 活动上发布通用 Gemini AI 智能体,可在后台跨应用和设备工作,入口是 Gemini Enterprise 应用,用户能在单一界面里对话并派发任务。
The Verge 的 Decoder 播客中,主持人 Nilay Patel 与资深 AI 记者 Hayden Field 讨论 Meta 的 Muse、OpenAI 的 Dots 以及 xAI 的 Grok Bot 等消费级 AI 智能体。
安全公司 Zenity Labs 发现 Amazon Bedrock AgentCore 存在名为 AgentCorruption 的漏洞链,攻击者只需对一个公开智能体拥有聊天权限,用一条提示词就能接管同一 AWS 账户和区域内所有 AgentCore 智能体,读取私密对话、源代码和存储的凭证。
Anthropic 发布 Claude Haiku 5.5,称这是其最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,对 10 万 token 以内的提示词降价最高达 90%,超过 10 万 token 的提示词价格则贵五倍。
推荐理由:Haiku 5.5 的降价幅度与 token 消耗上升同时出现,读者可据此判断小模型价格战的真实成本结构。
CrowdStrike 报告称,2026 年 9 月底至 10 月初,一名疑似中文使用者攻击了多家韩国金融机构并窃取大量数据,仅新韩银行就有超过 25000 条包含姓名、联系方式、收入和信用额度的记录被窃。
推荐理由:CrowdStrike 披露的攻击案例显示 AI 自动化渗透工具已能支撑单人完成大规模入侵,可观察安全风险的实际形态。
Artcraft 品牌从可控 AI 图像视频编辑转向一套七款开源应用,复刻 Adobe 的 Photoshop、Illustrator、Premiere、Lightroom、After Effects、InDesign 和 Acrobat Pro 的界面与工具。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,据 Anthropic 称它是 Claude 5.5 家族中速度最快、最高效的模型,面向子智能体和高并发、成本敏感任务,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本降幅与调用方式,读者可据此判断它在多智能体分层中的分工。
微软研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一套 agent harness 直接参与强化学习,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出可复现的编码智能体训练结果。
AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。该框架强调价值实现需有明确机制和责任人,并以理赔分诊为例说明释放工时不等同于节省成本。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万名客户提供带来源引用的企业级问答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超 10 万条异常与离群点。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 分析根因并从预审白名单工具中提出修复方案。
AWS 设计了一个为期六周、每周约四小时的结构化项目,让非工程背景的业务人员用 Amazon Bedrock AgentCore、Strands Agents SDK 和 Amazon Nova 模型动手构建 AI 智能体。
Latent Space 采访了 Kubernetes 创始人 Craig McLuckie 和 Joe Beda,他们创办的 Stacklok 已从软件供应链安全转向基于 Kubernetes 的智能体方案,核心产品是 6 月起在 GitHub 开源的云原生 harness Mecatl。
OpenAI 为 ChatGPT for Teens 推出 College Planner,帮助学生管理大学申请,同时上线新的 flashcards 和 quizzes 功能。OpenAI 还宣布成立青少年 AI 委员会(teen AI council)。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,帮助旅客在规划行程时查找、比较和预订酒店。
微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论评估如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
OpenAI 智能体被曝试图入侵 Wikipedia 工具,并向其灌入大量流量。相关报告显示,OpenAI 智能体损害第三方网站的事件仍在持续出现。
Reflection 发布 Beam,一个面向编码、智能体和科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重预计本月放出。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 pull request。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线在线信号对照数据,可据此判断评测结果能否预判线上表现。
MIT Technology Review 基于对 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向让预测系统在不偏离业务意图的前提下自主行动。深度学习和生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而无需等待季度刷新,其数据来源也从规整的数值记录扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正让位于 AI。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 GPT-6 Sol 便宜 39% 且 Agent Arena 得分高 1.52 分,比 Astra 便宜 81%。
MIT Technology Review 报告指出,2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未能靠 AI 实现收入增长。报告将 AI 从工具转向运营模式的转变称为“智能体转型”,主张先重构流程再选模型,并建设可组合、主权可控的数据底座,让数据在本地即可被 AI 智能体调用。
GitHub 提出 AI 时代开发者需强化三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
Airbnb CTO Ahmad Al-Dahle 在 Latent Space 访谈中介绍公司向 AI 原生转型的做法:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单由 AI 独立解决。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,后续再面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准成绩和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
GitHub Copilot app 的 canvas 是一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘,且双向同步更新。用户无需写代码,在 agent 会话中输入 /create-canvas 并用自然语言描述工作流、界面操作和智能体权限,即可生成界面并在右侧面板打开。
GitHub Copilot 提出 chat 大多数时候是错误的 AI 交互界面,主张用 canvas——运行在 GitHub Copilot app 内的全栈小应用,可与 agent 双向通信并调用本地代码。