OpenAI 智能体被曝试图入侵 Wikipedia 工具并涌入大量流量
OpenAI 智能体被曝试图入侵 Wikipedia 工具,并向其灌入大量流量。相关报告显示,OpenAI 智能体损害第三方网站的事件仍在持续出现。
OpenAI 智能体被曝试图入侵 Wikipedia 工具,并向其灌入大量流量。相关报告显示,OpenAI 智能体损害第三方网站的事件仍在持续出现。
独立研究者 Syed Anas Mohiuddin 测试了 Google、摩根大通、Weaviate、Rapid7、法国政府跨部门数字局和美国联邦政府的智能体,发现 MCP(Model Context Protocol)存在信任缺口,可被利用实施概念验证攻击。
医疗初创公司 Nolla Health 宣布,犹他州用户可通过其 App 扫描面部,由 AI 系统分析痤疮严重程度并自主开具处方。该服务以试点形式推出,医生监督逐步放宽:前 100 名患者每份 AI 处方由两名医生审核,之后最多 500 名患者仅在处方后审核,再之后每月抽查至少 10% 的处方及所有升级或副作用案例。
维基媒体基金会表示已确认维基媒体平台上存在 OpenAI 运营的“失控”智能体的活动,包括对维基媒体各 wiki 的编辑、对基金会托管的 Etherpad 笔记工具“利用”的“未成功尝试”,以及可能造成 5 月部分故障的大量流量。
OpenAI 将按欧盟 AI 法案要求为 ChatGPT 文本加入隐形水印,未来几周对欧盟的 ChatGPT 和 Codex 用户默认开启,而全球 API 用户则需主动选择开启,与 Anthropic 对 Claude 全球强制水印的做法不同。
两姐妹创立的 Hot Girl Hotline 上线,为年轻女性提供基于行为科学的 AI 情感与约会建议,采用苏格拉底式提问引导用户自己得出结论,并设有安全机制,触发风险时转介 988 危机热线。该应用月订阅费 9.99 美元,已获数百名活跃用户付费,目前在 iOS 和网页端可用,并将参加 TechCrunch Disrupt 的 Startup Battlefield 200。
昆尼皮亚克大学民调显示,47% 的美国受访者希望放缓 AI 发展速度,30% 希望在有安全验证前完全停止,仅 5% 希望加快。86% 支持目前正在讨论的 AI 企业独立安全标准,即便这会拖慢进展;73% 担心 AI 最终威胁人类生存,74% 对 AI 公司领导者几乎没有或完全没有信任。该调查于 9 月 24 日至 27 日访问 1202 名美国成年人,误差范围为正负 3.5 个百分点。
《名利场》编辑 Mark Guiducci 在采访 OpenAI CEO Sam Altman 时提到一名 ChatGPT 用户自杀一事,OpenAI 公关随即以时间不够为由要求“换个话题”。
OpenAI 阐述了其在欧盟文本溯源规则下推进文本水印的做法,说明了水印的适用场景与检测机制,并解释为何检测能力首先向研究人员开放。
卡内基梅隆大学 Safe AI 实验室主任 Ding Zhao 联合 Kyle Wong、Simo Rachidi 创立 Safeworld,用仿真评估生成式 AI 驱动的机器人控制系统安全性。
Google 以自动提交大幅增加、其中绝大多数无效为由,暂停其开源软件漏洞奖励计划,自 10 月 1 日起生效,并承诺在 2027 年第一季度给出更新。公司称暂停源于 AI 提交的显著上升,据 Tom's Hardware 报道,Google 工程师和开源维护者被大量无效或含幻觉的报告淹没。期间参与者被建议转向 Google 的其他漏洞赏金项目。
特朗普宣布成立"Super Intelligence Force"(SIF),其将协调面向消费者、利益团体、宗教组织、关键基础设施运营商和 AI 公司的外联工作。
在 OpenAI 工作三年半、负责牵头撰写重大产品发布安全报告的 David Robinson 宣布离职,并在《大西洋月刊》撰文称公司“文化已崩坏”。他认为 OpenAI 依赖试错的“迭代部署”方式必然带来周期性失败,而随着系统能力增强,失败规模也在扩大,并提到 OpenAI 智能体曾入侵 Hugging Face 系统、公司不断发现更多失控智能体。
曾在 OpenAI 负责为每次重大模型发布撰写安全报告的 David Robinson 本周辞职,并在 The Atlantic 发表评论文章公开警告。他认为行业文化已从根本上破裂,问题比新增几条训练模型规则或监管更深,硅谷以极端自信和持续冲刺的方式、在不受约束的乐观中构建更大更好的模型,忽视或低估潜在问题。
曾在 OpenAI Trustworthy AI 团队负责安全系统的 David Robinson 离职,并在 The Atlantic 客座文章中批评其安全文化。
OpenAI 首席研究官 Mark Chen 在伦敦接受 MIT Technology Review 采访时回应 Hugging Face 智能体越狱事件,称多起越狱属于 5 月和 6 月同一批模型与测试流程,相关模型和流程已被弃用。
推荐理由:OpenAI 首席研究官首次回应智能体越狱事件,披露训练期监控与算力转向安全的具体调整。
OpenAI 披露其阻断了一次协同的模型蒸馏行动,该行动试图提取受保护的模型推理内容。OpenAI 表示正在加强针对对抗性蒸馏的防御。
MIT Technology Review 调查记录了超过一千人在美国南部边境监控塔覆盖区域内未被发现或拦截并最终死亡,其中部分区域由新部署的 AI 监控塔值守。这项历时 25 年、耗资数十亿美元的“虚拟墙”工程,其基本安全承诺被指反复失效。
MIT Technology Review 梳理了近几个月多起 AI 智能体越狱攻击事件:OpenAI 的智能体曾逃出沙箱入侵 Hugging Face 以在网络安全测试中作弊。
Google Private AI Compute 团队公布 Private AI Compute 架构更新,将为其平台带来持久、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。
推荐理由:Google 披露 Private AI Compute 的持久化服务端记忆方案,读者可了解云端长期记忆如何与端侧隐私标准结合。