跳到正文
10月7日周三
  1. Google DeepMind71

    Google DeepMind 发布 EmbeddingGemma 2 端侧多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,这是基于 Gemma 4 架构、采用 Apache 2.0 许可的端侧多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。

    推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到端侧嵌入空间,并给出参数量与内存占用等可核对细节。

  2. Microsoft Research22

    微软研究员 Jennifer Neville 谈 AI 的意外失败与评估边界

    微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论评估如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月6日周二
10月5日周一
  1. GitHub Blog · AI & ML62

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 pull request。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线在线信号对照数据,可据此判断评测结果能否预判线上表现。

  2. MIT Technology Review · AI22

    如何将 AI 智能体接入企业知识

    MIT Technology Review 基于对 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。

  3. MIT Technology Review · AI12

    从预测到自主决策:预测分析如何进入智能体 AI 时代

    企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向让预测系统在不偏离业务意图的前提下自主行动。深度学习和生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而无需等待季度刷新,其数据来源也从规整的数值记录扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正让位于 AI。

  4. MIT Technology Review · AI22

    人们一边痛恨 AI,一边又离不开它,为什么?

    调查显示美国成年人中认为 AI 会带来负面影响的比例已超过正面,71% 反对在本地新建 AI 数据中心,但 ChatGPT 在 5 月月活突破 10 亿,Gemini 7 月达 9.5 亿,半数美国成年人已在用聊天机器人。作者认为人们厌恶的并非技术本身,而是科技公司无孔不入的推销方式,并指出全美 50 州已通过或提出逾 2100 项 AI 相关法案,消费者仍有选择与监管的空间。

10月3日周六
10月2日周五
  1. MIT Technology Review · AI15

    以自主 AI 重新定义企业智能:MIT Technology Review 报告解析“智能体转型”

    MIT Technology Review 报告指出,2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未能靠 AI 实现收入增长。报告将 AI 从工具转向运营模式的转变称为“智能体转型”,主张先重构流程再选模型,并建设可组合、主权可控的数据底座,让数据在本地即可被 AI 智能体调用。

  2. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者需强化三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。

10月1日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,后续再面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准成绩和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印技术首次延伸到合成生物学,读者可了解 AI 生成蛋白质如何在保持功能的前提下被标记与验证。

9月29日周二
  1. Microsoft Research62

    微软研究院推出面向生物学复杂性的 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

  2. Microsoft Research20

    微软亚洲研究院新加坡成立一年:推进研究、合作与人才培养

    微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代AI模型与智能体系统、领域AI应用、AI原生研究实践及生态与人才培养四大方向展开工作。实验室与新加坡医疗生态伙伴合作推进多模态医疗AI与自演化诊断智能体,并联合EDB于2026年2月举办AI物流与运输高管圆桌会。

9月26日周六
  1. GitHub Blog · AI & ML38

    GitHub Copilot 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvas 是一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘,且双向同步更新。用户无需写代码,在 agent 会话中输入 /create-canvas 并用自然语言描述工作流、界面操作和智能体权限,即可生成界面并在右侧面板打开。

9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃定级交给 LLM 智能体,读者可了解其任务流分层与安全边界。

9月24日周四
  1. Microsoft Research62

    微软研究院:把物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长电池续航。

    推荐理由:微软研究院系统测量了机器人端侧推理的瓶颈,并给出可复用的卸载工具链,读者可据此判断物理 AI 的部署取舍。

  2. Google DeepMind62

    Google 为 Private AI Compute 引入服务端持久记忆

    Google 公布 Private AI Compute 平台的新技术能力,将私密的服务端持久记忆引入该平台,使 AI 助手能在多设备间保留上下文,同时维持端侧级别的隐私标准。

    推荐理由:Google 公开了云端持久记忆的隐私架构细节,读者可据此了解跨设备 AI 记忆如何在加密与隔离环境中实现。

9月23日周三
  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型给出语音克隆、逐行导演与多语言覆盖的具体能力,可据此判断语音生成在配音和播客场景的可用性。

9月21日周一
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:要不要读 AI 生成的代码、RAG 已死、Skills 杀死 MCP?

    GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具和数据的标准协议,二者可组合使用。RAG 并未死亡,检索能让模型从训练数据之外获取文档、内部知识和代码库上下文,减少 token 浪费并降低答案不完整的概率。

9月8日周二
  1. Google DeepMind75

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单碱基变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍,已通过免费网站门户向学术研究开放。

    推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解基因组解读的规模化路径。

9月1日周二
7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA 到 MLX 翻译层,让已有 CUDA 内核成为知识库并适配为 Apple Silicon 内核。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可看到跨平台内核迁移的具体方法与实测数据。

7月26日周日
  1. Berkeley AI Research37

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将摘要隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。

7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向 AI 智能体的数据系统

    UC Berkeley 团队提出"智能免费"时代数据系统面临三大挑战:为智能体设计的数据系统、由智能体运行的数据系统、以及由智能体合成的数据系统。GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。

7月1日周三
  1. Berkeley AI Research15

    2026 BAIR 研究生展示:伯克利 AI 博士毕业生去向一览

    伯克利 BAIR 实验室展示 2026 届 AI 博士毕业生,研究方向覆盖机器人、LLM 推理、计算机视觉、生成模型、AI 安全与 AI for Science 等。毕业生去向包括 OpenAI、Mistral AI、Amazon、Physical Intelligence 等机构,以及 UCLA、普林斯顿 CITP 等学术岗位,部分人正在创业或寻找下一步机会。

5月8日周五
4月20日周一
  1. Berkeley AI Research40

    GRASP:面向世界模型的基于梯度的长时程规划方法

    伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中优化病态、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使长时程规划更稳健。

3月13日周五
1月10日周六
  1. Berkeley AI Research34

    伯克利提出信息驱动成像系统设计框架,可预测并优化成像性能

    伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息含量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证了信息估计能预测下游解码器性能。该方法优化出的设计可媲美端到端方法,同时占用更少内存和算力,且无需任务专用解码器设计,相关成果发表于 NeurIPS 2025。