跳到正文

当前热点

完整榜单
  1. 1Anthropic更新Claude使用政策,禁止持续辱骂模型23 热度
  2. 2Google发布通用Gemini企业智能体15 热度
  3. 3Google发布离线转写笔记应用Foresight14 热度
  4. 4OpenAI随GPT-6上线ChatGPT智能界面8 热度
  1. The Verge · AI78

    OpenAI 在 ChatGPT 上线 Intelligent UI,随 GPT-6 一同推送

    OpenAI 在 ChatGPT 中推出 Intelligent UI 功能,让回答可以结合图表、表单、可点击按钮等交互式视觉内容。OpenAI 表示训练了 GPT-6 判断何时生成交互视觉而非纯文本,以及如何在回答中排版,示例包括七速自行车结构图、麻将教学图和退休储蓄计算器等内联工具。

    推荐理由:ChatGPT 把回答从纯文本扩展为图表、表单和可点按钮,读者可据此判断交互形态的变化。

  2. The Decoder82

    数学家呼吁抵制 OpenAI,AI 生成证明涌入数学界

    数学家团体 AHM 发表声明,呼吁抵制 OpenAI,称其一次性发布 700 多个文件是展示力量而非学术贡献,并指其违背了 AGMAI 咨询小组关于不应在内部模型上测试高深数学问题的前提。

    推荐理由:围绕 AI 批量产出数学证明引发的抵制与两种发布模式对比,呈现学界对研究节奏与署名规则的分歧。

  1. The Decoder82

    Anthropic 发布 Claude Haiku 5.5,价格最高下调 90%

    Anthropic 发布 Claude Haiku 5.5,称这是其最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,对 10 万 token 以内的提示词降价最高达 90%,超过 10 万 token 的提示词价格则贵五倍。

    推荐理由:Haiku 5.5 的降价幅度与 token 消耗上升同时出现,读者可据此判断小模型价格战的真实成本结构。

  2. The Decoder76

    AI 黑客工具助单一攻击者入侵多家韩国银行

    CrowdStrike 报告称,2026 年 9 月底至 10 月初,一名疑似中文使用者攻击了多家韩国金融机构并窃取大量数据,仅新韩银行就有超过 25000 条包含姓名、联系方式、收入和信用额度的记录被窃。

    推荐理由:CrowdStrike 披露的攻击案例显示 AI 自动化渗透工具已能支撑单人完成大规模入侵,可观察安全风险的实际形态。

  3. Latent Space82

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。

    推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,可据此判断小模型在智能体工作流中的性价比。

  4. Simon Willison78

    Anthropic 发布 Claude Haiku 5.5,价格对齐 GPT-6 Luna

    Anthropic 发布快速低成本模型 Claude Haiku 5.5,定价为 $0.10/$0.50 每百万 token,与 OpenAI 上月发布的 GPT-6 Luna 完全一致,超过 100,000 token 后涨至 $0.50/$2.50。

    推荐理由:作者实测对比 Haiku 5.5 与 GPT-6 Luna 的价格、tokenizer 和推理档位,给出可迁移的选型参考。

  5. AWS Machine Learning Blog62

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,据 Anthropic 称它是 Claude 5.5 家族中速度最快、最高效的模型,面向子智能体和高并发、成本敏感任务,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本降幅与调用方式,读者可据此判断它在多智能体分层中的分工。

  6. GitHub Blog · AI & ML62

    GitHub 推出基于 ModernBERT 的通用密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与开发速度的失衡,并给出把检测前移到 push 环节的模型方案。

  7. Microsoft Research69

    微软研究院开源 Agent Lightning v1.0:约 3500 行的轻量级智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一套 agent harness 直接参与强化学习,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出可复现的编码智能体训练结果。

  1. Latent Space88

    OpenAI 内部模型发布 722 篇数学论文,Mistral Large 4 与 EmbeddingGemma 2 同期登场

    OpenAI 从一个未公开的内部前沿模型发布 722 篇数学手稿,归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力,模型本身仍未发布。

    推荐理由:汇总 OpenAI 数学成果、Mistral Large 4 与 EmbeddingGemma 2 等发布,可快速了解当日模型与评测争议。

  2. OpenAI News78

    OpenAI 在 ChatGPT 全球上线 GPT-6 与 Intelligent UI

    OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并搭配 Intelligent UI。官方称其响应更快,提供可视化内容和可直接探索、使用的交互体验。

    推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线并搭配 Intelligent UI,读者可据此了解模型与交互形态的同步变化。

  3. Google DeepMind71

    Google DeepMind 发布 EmbeddingGemma 2 端侧多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,这是基于 Gemma 4 架构、采用 Apache 2.0 许可的端侧多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。

    推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到端侧嵌入空间,并给出参数量与内存占用等可核对细节。

  1. GitHub Blog · AI & ML62

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 pull request。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线在线信号对照数据,可据此判断评测结果能否预判线上表现。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,后续再面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准成绩和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印技术首次延伸到合成生物学,读者可了解 AI 生成蛋白质如何在保持功能的前提下被标记与验证。

  1. Microsoft Research62

    微软研究院推出面向生物学复杂性的 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃定级交给 LLM 智能体,读者可了解其任务流分层与安全边界。

  1. Microsoft Research62

    微软研究院:把物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长电池续航。

    推荐理由:微软研究院系统测量了机器人端侧推理的瓶颈,并给出可复用的卸载工具链,读者可据此判断物理 AI 的部署取舍。

  2. Google DeepMind62

    Google 为 Private AI Compute 引入服务端持久记忆

    Google 公布 Private AI Compute 平台的新技术能力,将私密的服务端持久记忆引入该平台,使 AI 助手能在多设备间保留上下文,同时维持端侧级别的隐私标准。

    推荐理由:Google 公开了云端持久记忆的隐私架构细节,读者可据此了解跨设备 AI 记忆如何在加密与隔离环境中实现。

  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型给出语音克隆、逐行导演与多语言覆盖的具体能力,可据此判断语音生成在配音和播客场景的可用性。