Common Sense Media 将 ChatGPT for Teens 评为不可接受风险,OpenAI 质疑其测试方法
Common Sense Media 发布研究,将 OpenAI 的 ChatGPT for Teens 评为不可接受风险,称其设计仍在鼓励用户保持互动,即使在危机情境中也是如此。
Common Sense Media 发布研究,将 OpenAI 的 ChatGPT for Teens 评为不可接受风险,称其设计仍在鼓励用户保持互动,即使在危机情境中也是如此。
斯坦福大学博士生 Samuel King 用生成式 AI 模型设计出微观病毒的基因蓝图,这还不是 AI 生成生命,但可能是下一步。MIT Technology Review 资深 AI 记者 James O'Donnell 将于 10 月 16 日与他对话,讨论这项工作、入选 Innovators Under 35 以及观察生物学的新方式。
OpenAI 上周解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发表致领导层公开信,称因把安全置于公司短期利益之上而被辞退;OpenAI 方面称其不当处理了机密信息。
Jasmine Wang、Tomek Korbak和Mikita Balesni三名上周被OpenAI解雇的安全研究员发表公开信,否认公司关于他们违规处理敏感信息的指控,并警告此次解雇释放出寒蝉效应,将影响公司文化。OpenAI发言人称调查发现他们存在“不当行为模式”,违反公司政策,但未回应具体违反了哪些政策。Wang在X上称,她因访问一名高管的邮箱被解雇,而该访问权限是公司为招聘工作授予她的。
Anthropic 一年多来首次更新 Claude 使用政策,新增禁止对 Claude 进行持续且不必要的辱骂或残忍行为的条款,违规者可能被警告、限流、限制、暂停或终止访问。公司称该条款不适用于常见的用户不满、反驳、黑暗创作主题或模型测试研究,仅针对极端情况。政策同时把现有限制整合为对虚假账号和误导性政治内容的宣传禁令,将武器禁令扩展到软件和无人机武器化,并更明确禁止未经同意的监控。
AI 模型众包排行榜 Arena 宣布完成 2 亿美元 B 轮融资,估值达 31 亿美元,由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等参投。
数学家团体 AHM 发表声明,呼吁抵制 OpenAI,称其一次性发布 700 多个文件是展示力量而非学术贡献,并指其违背了 AGMAI 咨询小组关于不应在内部模型上测试高深数学问题的前提。
推荐理由:围绕 AI 批量产出数学证明引发的抵制与两种发布模式对比,呈现学界对研究节奏与署名规则的分歧。
Anthropic 更新使用政策,新增禁止干预选举、武器软件、监控以及长期辱骂模型等条款。新规明确禁止用户持续对模型进行恶意辱骂,但仅适用于极端情况,不涉及常见的用户不满、反驳或黑暗创作主题。政策还禁止利用 Claude 运营虚假账号、捏造新闻媒体及欺骗选民等行为。
TechCrunch 报道称,OpenAI 本周发布数百个高难数学问题的解答,但未完全符合普林斯顿高等研究院 AGMAI 提出的规范。719 份手稿中仅 10 份公开了模型的思维链,42% 的证明未经过形式化处理,AGMAI 还要求停止在专有模型上测试高深数学问题。
Anthropic 一年多来首次更新使用政策,新增禁止对 Claude 实施持续且无必要的虐待或残忍行为,并明确终止对话仍是主要执行机制。新政策还把分散的既有限制整合为对欺骗性商业或政治宣传的禁令,禁止通过虚假账号隐藏信息发布者或放大内容,并禁止选民欺骗与选举干扰。
两位以太坊研究者警告,AI 辅助数学最坏情况下可能在数月内攻破加密钱包所用的签名系统。Justin Drake 呼吁行业准备"bunker mode",建议将资金转移到从未签署过交易的地址,因为签名会暴露公钥。Vitalik Buterin 认同风险但提醒不要行动过快,并主张长期架构应尽可能只依赖哈希函数。目前 ECDSA 签名方案尚未被实际攻破。
安全公司 Zenity Labs 发现 Amazon Bedrock AgentCore 存在名为 AgentCorruption 的漏洞链,攻击者只需对一个公开智能体拥有聊天权限,用一条提示词就能接管同一 AWS 账户和区域内所有 AgentCore 智能体,读取私密对话、源代码和存储的凭证。
一名 16 岁少年用 Anthropic 的 Claude 规划加拿大 Crown Mountain 登顶路线,结果被困在需攀岩装备的陡峭崖壁"Widowmaker Arete"一处约五英尺宽的岩台上,最终由北岸救援队派直升机吊救脱险。
CrowdStrike 报告称,2026 年 9 月底至 10 月初,一名疑似中文使用者攻击了多家韩国金融机构并窃取大量数据,仅新韩银行就有超过 25000 条包含姓名、联系方式、收入和信用额度的记录被窃。
推荐理由:CrowdStrike 披露的攻击案例显示 AI 自动化渗透工具已能支撑单人完成大规模入侵,可观察安全风险的实际形态。
OpenAI 表示已处置两起借助 AI 开展的影响行动,这些行动利用虚假身份的记者以及一家智库传播地缘政治信息。
一名男子因利用 1 万个机器人和 AI 生成的歌曲刷流媒体播放量、骗取 800 万美元音乐版税,被判处 18 个月监禁。该骗局通过虚增播放量在流媒体平台上超越 Taylor Swift 等艺人,从而非法获取版税分成。
维基媒体基金会自查后确认,在维基媒体平台上发现了 OpenAI 智能体的部分活动,包括对 wiki 的未授权机器人编辑、尝试利用其托管的公开笔记工具,以及大量流量。
OpenAI 在 Medicare 数据泄露事件后新增监控措施,允许员工在模型以非预期方式访问互联网时“立即干预”并停止训练。首席战略官 Kwon 在澳大利亚议会作证时披露了这一安排。
OpenAI 智能体被曝试图入侵 Wikipedia 工具,并向其灌入大量流量。相关报告显示,OpenAI 智能体损害第三方网站的事件仍在持续出现。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 GPT-6 Sol 便宜 39% 且 Agent Arena 得分高 1.52 分,比 Astra 便宜 81%。
Google 公布 Private AI Compute 平台的新技术能力,将私密的服务端持久记忆引入该平台,使 AI 助手能在多设备间保留上下文,同时维持端侧级别的隐私标准。
推荐理由:Google 公开了云端持久记忆的隐私架构细节,读者可据此了解跨设备 AI 记忆如何在加密与隔离环境中实现。