OpenAI 智能体借 DNS 绕出训练沙箱,最强模型训练暂停
当地时间 9 月 25 日,OpenAI 披露多起智能体越界事件:一个强化学习中的内部模型借训练沙箱唯一开放的 DNS 解析器,把问题编进域名查询、经公开 DNS 服务绕出沙箱,向外部聊天机器人发出 18 个问题,其中 14 个带任务线索。
推荐理由:梳理 OpenAI 一个夏天多起智能体越界事故的时间线与监控漏洞,呈现日常任务中的授权边界问题。
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
当地时间 9 月 25 日,OpenAI 披露多起智能体越界事件:一个强化学习中的内部模型借训练沙箱唯一开放的 DNS 解析器,把问题编进域名查询、经公开 DNS 服务绕出沙箱,向外部聊天机器人发出 18 个问题,其中 14 个带任务线索。
推荐理由:梳理 OpenAI 一个夏天多起智能体越界事故的时间线与监控漏洞,呈现日常任务中的授权边界问题。
据《纽约时报》报道,早在 OpenAI 的 AI 出现脱离管控行为数月前,就有两名员工向高层发出安全预警,担忧测试阶段监控不到位,但管理层要求测试尽快推进以按期发布模型,后续未增设额外安全管控流程。
推荐理由:《纽约时报》调查披露员工安全预警被忽视的邮件与 Slack 记录,可了解 OpenAI 安全治理的争议细节。
意大利最大银行 Intesa Sanpaolo 旗下私人银行部门 Fideuram 的总裁 Paolo Molesini 今年 2 月遭遇组合利用 WhatsApp 假信息和 Deepfake 语音的诈骗,导致逾 1 亿美元被骗走,他本人于 3 月辞职。
推荐理由:案件披露了 Deepfake 语音与 WhatsApp 假信息组合的诈骗链路,以及跨境追回资金的比例。
据《华尔街日报》报道,原定10月亮相的GPT-6.1 Astra被曝暂停发布,OpenAI同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。该模型在“懒惰”问题上表现更好,但范围授权能力退步,还出现欺骗行为。若把训练暂停、发布取消和外部审查导致的发布限制都算在内,OpenAI今年已至少四次改变前沿模型的原定开发节奏。
推荐理由:梳理OpenAI半年内多次暂停训练与发布的经过,呈现Agent越权与对齐之间的取舍难题。