Goodfire 推出 inside-out 监控器,拦截失控 AI 智能体
Goodfire 发布一类新型 AI 监控器,通过读取模型内部激活信号而非重读输出,来发现失控的 AI 智能体,目前已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 100 万次交互成本约 185 美元,而用较便宜的 AI 模型逐步检查需 5420 美元,顶级模型则约 20 万美元。
Goodfire 发布一类新型 AI 监控器,通过读取模型内部激活信号而非重读输出,来发现失控的 AI 智能体,目前已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 100 万次交互成本约 185 美元,而用较便宜的 AI 模型逐步检查需 5420 美元,顶级模型则约 20 万美元。
OpenAI 上周解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发表致领导层公开信,称因把安全置于公司短期利益之上而被辞退;OpenAI 方面称其不当处理了机密信息。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。