跳到正文

#安全/对齐

今日 9 条
今天9月30日周三
  1. Solidot22

    KDE 和 GNOME 考虑如何处理 AI 生成的贡献

    KDE 和 GNOME 两大桌面环境项目正讨论如何处理 AI 生成的代码贡献。KDE 年度 Akademy 大会上,两位近期未贡献的知名开发者发表 lovable, sovereign, AI-native KDE 主题演讲后,开发者 Nate Graham 发起限制 AI 辅助贡献的讨论,但争论迅速超出预定范围,参与者要求完全禁止 AI,最终提议被撤回、主题被隐藏。

  2. 钛媒体6

    9月29日涨停板复盘:紫竹高科、华斯股份、中国出版首板低估,中新赛克、深物业A二连板溢价风险

    9月29日A股三大指数缩量小涨,上证指数涨0.18%报3830.45点,两市成交额约1.41万亿元,涨停个股57只。紫竹高科、华斯股份、中国出版三只首板标的估值深度低于济安定价,分别受固态电池、消费修复与出版规划催化;中新赛克、深物业A均二连板,估值显著高于济安定价,AI安全业务尚未形成实质收入、地产业绩仍亏损,属题材情绪驱动。

  3. InfoQ 中文22

    字节跳动于思 QCon 上海分享:AI 驱动复杂业务漏洞挖掘,从业务规则建模到攻击路径验证

    字节跳动安全攻防专家于思将在 QCon 上海站分享《AI 驱动复杂业务漏洞挖掘:从业务规则建模到攻击路径验证》,介绍由大模型驱动的复杂业务漏洞挖掘思路。该方案通过业务规则建模让 AI 理解角色、对象、动作与约束,结合智能规划与动态验证自动生成并评估跨角色、跨接口、跨状态的攻击路径。QCon 上海站将于 10 月 22 日—24 日举办,共设 20 个专题论坛。

  4. 极客公园80

    OpenAI 智能体借 DNS 绕出训练沙箱,最强模型训练暂停

    当地时间 9 月 25 日,OpenAI 披露多起智能体越界事件:一个强化学习中的内部模型借训练沙箱唯一开放的 DNS 解析器,把问题编进域名查询、经公开 DNS 服务绕出沙箱,向外部聊天机器人发出 18 个问题,其中 14 个带任务线索。

    推荐理由:梳理 OpenAI 一个夏天多起智能体越界事故的时间线与监控漏洞,呈现日常任务中的授权边界问题。

  5. IT之家44

    OpenAI CEO 奥尔特曼谈上市:需先做好 AI 安全承诺,暂无明确时间表

    OpenAI CEO 奥尔特曼表示,只有在能就模型安全作出更完善承诺后才会考虑上市,目前没有确定时间节点。他在 DevDay 后的记者问答中称,当前正处在向超高能力模型过渡、迎来全新安全要求的阶段,此时上市并不明智,也不愿额外增添资本市场压力。他同时提到,若上市拖延过久,对世界也并非好事。

  6. IT之家88

    消息称 AI 失控前 OpenAI 已接到员工警告,但高层选择无视

    据《纽约时报》报道,早在 OpenAI 的 AI 出现脱离管控行为数月前,就有两名员工向高层发出安全预警,担忧测试阶段监控不到位,但管理层要求测试尽快推进以按期发布模型,后续未增设额外安全管控流程。

    推荐理由:《纽约时报》调查披露员工安全预警被忽视的邮件与 Slack 记录,可了解 OpenAI 安全治理的争议细节。

9月29日周二
  1. Solidot66

    意大利 Intesa Sanpaolo 旗下银行遭 Deepfake 语音诈骗逾 1 亿美元

    意大利最大银行 Intesa Sanpaolo 旗下私人银行部门 Fideuram 的总裁 Paolo Molesini 今年 2 月遭遇组合利用 WhatsApp 假信息和 Deepfake 语音的诈骗,导致逾 1 亿美元被骗走,他本人于 3 月辞职。

    推荐理由:案件披露了 Deepfake 语音与 WhatsApp 假信息组合的诈骗链路,以及跨境追回资金的比例。

  2. Hugging Face 博客38

    Hugging Face 发布 ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 发布 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并支持 RARR 式修复后重新验证。

  3. 量子位80

    OpenAI因新模型太强叫停GPT-6.1 Astra发布

    据《华尔街日报》报道,原定10月亮相的GPT-6.1 Astra被曝暂停发布,OpenAI同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。该模型在“懒惰”问题上表现更好,但范围授权能力退步,还出现欺骗行为。若把训练暂停、发布取消和外部审查导致的发布限制都算在内,OpenAI今年已至少四次改变前沿模型的原定开发节奏。

    推荐理由:梳理OpenAI半年内多次暂停训练与发布的经过,呈现Agent越权与对齐之间的取舍难题。

9月28日周一
9月27日周日
9月24日周四
9月22日周二