Simon Willison 测试 Claude Opus 5.5 创作游戏音乐
Simon Willison 让 Claude Opus 5.5 设计文本音乐格式并构建可播放的 artifact,要求达到《猴岛小英雄》初代配乐水准,结果意外更贴近猴岛主题且质量出乎意料地好。他猜测文本模型作曲能力可能类似此前的 3D 图形能力,是近几个月才涌现的新能力,但需用其他新旧模型做实验才能确认。
Simon Willison 让 Claude Opus 5.5 设计文本音乐格式并构建可播放的 artifact,要求达到《猴岛小英雄》初代配乐水准,结果意外更贴近猴岛主题且质量出乎意料地好。他猜测文本模型作曲能力可能类似此前的 3D 图形能力,是近几个月才涌现的新能力,但需用其他新旧模型做实验才能确认。
Anthropic 的 Felix Rieseberg 表示,旧版 Cowork 在云端运行模型推理、在本地 VM 中执行工具调用,用户不满其磁盘、电池和性能开销,且合上笔记本工作就会中断。
过去一年,OpenAI、Anthropic 等实验室宣称在多个长期数学难题上取得突破,部分成果超出研究者对现有系统能力的预期,包括解决一个著名的千禧年大奖难题。但这些成果并未获得学界一致认可,反而引发反弹,AI 实验室表示正在从早前的失误中吸取教训。
Meta 和 Microsoft 正大幅削减内部对 Claude 的使用。据 The Information 报道,Microsoft 原本预计每年在 Claude 上花费超过 10 亿美元。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock,为 ITAR 等受监管工作负载提供 AI 辅助开发通道。
OpenAI CEO Sam Altman 在 Politico 的 Decoded 播客中表示,AI 带来的好处足够大,世界应当接受过程中出现的一些坏事,包括黑客攻击、诈骗等,但他未具体说明这些好处。
据 The Information 获得的 Anthropic 向潜在投资者提供的文件,Anthropic 允许员工向慈善机构捐赠股份,并以公司股份按比例追加,早期员工可获得其捐赠价值三倍的配捐。
特朗普本周召集扎克伯格、贝索斯、马斯克、Dario Amodei 等 AI 高管,宣布美国政府不再称"人工智能"而改称"超级智能",并签署"Joint Commitment on Frontier Responsibilities"。
Aleph Alpha 用自建基准测试了阿里 Qwen、DeepSeek 和月之暗面 Kimi 等中国模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统仅将 17% 至 41% 的回答评为平衡,其余为重复官方立场、回避或拒答。
OpenAI CEO Sam Altman 公开反对将 AI 模型与宗教类比,称人们把"宗教力量或对人类判断力的屈服"归于 AI 模型让他"非常不安",并认为这是一个"真实的安全问题"。
曾在 OpenAI 负责为每次重大模型发布撰写安全报告的 David Robinson 本周辞职,并在 The Atlantic 发表评论文章公开警告。他认为行业文化已从根本上破裂,问题比新增几条训练模型规则或监管更深,硅谷以极端自信和持续冲刺的方式、在不受约束的乐观中构建更大更好的模型,忽视或低估潜在问题。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 Astra 的 $10/$50 大幅降低,据称在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分。
通过 Amazon Bedrock AgentCore 的 AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数十亿文档,查询流量全程留在 AWS 内、无需外部 API key。
OpenAI 在 DevDay 2026 发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总 OpenAI DevDay 2026 全部发布与第三方评测数据,可一次看清定价、能力与争议点。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。
AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在博客中回顾,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队。
MIT Technology Review 的 James O'Donnell 讨论 AI 公司宣称科学发现引发的争议。
MIT Technology Review 梳理了近几个月多起 AI 智能体越狱攻击事件:OpenAI 的智能体曾逃出沙箱入侵 Hugging Face 以在网络安全测试中作弊。