Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%
Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建了多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,缩短 78%。该系统还把手动生命周期操作从 10 多个步骤压缩为 1 次交互,并将冗余告警中位数减少 65%,由三人团队在六个月内交付。
Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建了多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,缩短 78%。该系统还把手动生命周期操作从 10 多个步骤压缩为 1 次交互,并将冗余告警中位数减少 65%,由三人团队在六个月内交付。
NVIDIA 开发者用 GPT-6 Astra 等前沿 AI 模型配合 Omniverse 库,通过自然语言指令构建仿真应用。
AWS 介绍 Amazon Bedrock AgentCore payments 已正式可用,为 AI 智能体提供按需付费的托管能力,由基础设施层而非模型执行支出限额。
Oracle 在招聘、工程和运营场景中,用 ChatGPT Work 和 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作缩短到几分钟。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,据 Anthropic 称它是 Claude 5.5 家族中速度最快、最高效的模型,面向子智能体和高并发、成本敏感任务,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本降幅与调用方式,读者可据此判断它在多智能体分层中的分工。
在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。
推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体的落地条件。
微软研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一套 agent harness 直接参与强化学习,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出可复现的编码智能体训练结果。
AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。该框架强调价值实现需有明确机制和责任人,并以理赔分诊为例说明释放工时不等同于节省成本。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万名客户提供带来源引用的企业级问答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超 10 万条异常与离群点。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 分析根因并从预审白名单工具中提出修复方案。
AWS 设计了一个为期六周、每周约四小时的结构化项目,让非工程背景的业务人员用 Amazon Bedrock AgentCore、Strands Agents SDK 和 Amazon Nova 模型动手构建 AI 智能体。
OpenAI 为 ChatGPT for Teens 推出 College Planner,帮助学生管理大学申请,同时上线新的 flashcards 和 quizzes 功能。OpenAI 还宣布成立青少年 AI 委员会(teen AI council)。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,帮助旅客在规划行程时查找、比较和预订酒店。
微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论评估如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 pull request。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线在线信号对照数据,可据此判断评测结果能否预判线上表现。
GitHub 提出 AI 时代开发者需强化三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,后续再面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准成绩和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
GitHub Copilot app 的 canvas 是一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘,且双向同步更新。用户无需写代码,在 agent 会话中输入 /create-canvas 并用自然语言描述工作流、界面操作和智能体权限,即可生成界面并在右侧面板打开。
GitHub Copilot 提出 chat 大多数时候是错误的 AI 交互界面,主张用 canvas——运行在 GitHub Copilot app 内的全栈小应用,可与 agent 双向通信并调用本地代码。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃定级交给 LLM 智能体,读者可了解其任务流分层与安全边界。
GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具和数据的标准协议,二者可组合使用。RAG 并未死亡,检索能让模型从训练数据之外获取文档、内部知识和代码库上下文,减少 token 浪费并降低答案不完整的概率。
Berkeley AI Research 提出 ABBEL 框架,将摘要隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
UC Berkeley 团队提出"智能免费"时代数据系统面临三大挑战:为智能体设计的数据系统、由智能体运行的数据系统、以及由智能体合成的数据系统。GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。