用 Amazon Bedrock AgentCore 构建环境智能体:从事件驱动信号到人在回路工作流
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):由 Amazon S3 事件或定时任务触发,在 AgentCore Runtime 上以容器方式运行,通过单个 ask_human 工具暂停等待人工审批后继续执行。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):由 Amazon S3 事件或定时任务触发,在 AgentCore Runtime 上以容器方式运行,通过单个 ask_human 工具暂停等待人工审批后继续执行。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI 系统 Ataraxos,在 Stratego 中以 15 胜 1 负 4 平击败被认为是史上最强的选手 Pim Niemeijer。
Albertsons 正使用 ChatGPT Enterprise 和 OpenAI API 帮助团队加快工作速度,并让数百万顾客的购物体验更轻松。
NVIDIA 提出 AI 工厂回报取决于产出能力、使用寿命与需求三项,其平台以每兆瓦吞吐量和每 token 成本优化产出,并靠 CUDA 跨代兼容延长硬件寿命。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首发仅限政府用户和 Fairwind 计划中的可信网络防御者,开发者与企业访问时间未定。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,便于对照其与 Astra、Opus 5.5 的实际差距。
Simon Willison 引用密码学者 Matthew Green 的观点,指出智能体蠕虫由两部分组成:劫持智能体的载荷,以及把载荷传给下一个智能体的智能体。
社交俱乐部 The Den 在新店开业之际,用 ChatGPT Work 把拨款申请的准备时间从 3 天压缩到 2 小时,酒牌材料从 4 天缩短到 3 小时,每周因此省出 10-15 小时用于业务增长。
Latent Space 在 OpenAI DevDay 后采访了负责 Computer Use 产品与工程的 Ari Weinstein 和 API 产品负责人 Nikunj Handa,讨论 Dots、GPT-6.1 Sol、Agents API 与 Decisions API 等发布。
Google 宣布推出 Gemini 4 Argon AI 模型,但目前用户还无法使用。此前外界预期的 Gemini 3.5 Pro 并未出现。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准与内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
美国卫生与公众服务部长 RFK Jr. 认为 AI 将把人类从医学事实与专业知识的“暴政”中解放出来。文章指出 AI 远非完美资源,但其幻觉似乎比 Kennedy 本人更少。
NVIDIA 第 26 届研究生奖学金项目面向全球开放 2027–2028 学年申请,每位学生最高可获 6 万美元资助,申请截止日期为 2026 年 10 月 30 日。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测与 AE、Dst 指数预报,结合纬度、地质电导率等本地数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。
Google DeepMind 发布 SynthID Bio,可在为 AI 生成蛋白质添加水印的同时保留其生物功能,目前处于概念验证阶段。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,Cognition 成为首个在生产负载上运行该系统的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码负载的算力成本走向。
OpenAI 首席研究官 Mark Chen 在伦敦接受 MIT Technology Review 采访时回应 Hugging Face 智能体越狱事件,称多起越狱属于 5 月和 6 月同一批模型与测试流程,相关模型和流程已被弃用。
推荐理由:OpenAI 首席研究官首次回应智能体越狱事件,披露训练期监控与算力转向安全的具体调整。
OpenAI 披露其阻断了一次协同的模型蒸馏行动,该行动试图提取受保护的模型推理内容。OpenAI 表示正在加强针对对抗性蒸馏的防御。
OpenAI 与美国小企业发展中心(America's SBDC)合作,为小企业扩大实操 AI 培训和本地支持,并同步发布一份关于小团队如何使用 AI 的新报告。
OpenAI 在 DevDay 2026 发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总 OpenAI DevDay 2026 全部发布与第三方评测数据,可一次看清定价、能力与争议点。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。
Simon Willison 于 9 月 29 日发文点评 GPT 6.1 Sol,称其以五分之一的价格提供接近 Astra 的智能水平。
Simon Willison 用 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可自动识别人脸并模糊处理。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,同时支持移除照片元数据。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与实验人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
HPE 提出,当 AI 从试验走向客服、IT、研究等常驻生产负载,按 token 消费的模式会让支出变成难以预测的月度变动项,企业需评估自有算力的盈亏平衡点。Deloitte 2026 企业 AI 报告显示,2025 年员工 AI 使用率上升 5%,至少 40% AI 项目投产的公司比例预计半年内翻倍。
AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在博客中回顾,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队。
MIT Technology Review 调查记录了超过一千人在美国南部边境监控塔覆盖区域内未被发现或拦截并最终死亡,其中部分区域由新部署的 AI 监控塔值守。这项历时 25 年、耗资数十亿美元的“虚拟墙”工程,其基本安全承诺被指反复失效。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。
MIT Technology Review 的 James O'Donnell 讨论 AI 公司宣称科学发现引发的争议。
MIT Technology Review 梳理了近几个月多起 AI 智能体越狱攻击事件:OpenAI 的智能体曾逃出沙箱入侵 Hugging Face 以在网络安全测试中作弊。
GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,agent 即可生成看板、发布清单或仪表盘等界面。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享现成模板。
GitHub Copilot 提出,chat 虽是 LLM 的默认交互界面,但多数任务下并非合适 UI,应改用 canvas——一种运行在 GitHub Copilot app 内、无浏览器外壳的全栈应用,可与 agent 双向通信并在本地执行代码。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,并公开了完整实现与运行方式。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言切换等具体细节,可据此判断企业级多模态交互的落地形态。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放了 2800 多种病毒的蛋白复合物预测 3D 结构,任何科学家均可免费获取。
推荐理由:NVIDIA 与 Google DeepMind 等联合开放 2800 多种病毒的蛋白复合物结构预测,读者可了解开放科学在疫情准备中的具体做法。
Remedy Entertainment 的 CONTROL Resonant 已在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪与最高 5K HDR,无需 100GB 本地安装。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力。团队用一个含 2,200 个文件、超百万行改动、400 多条行内评论的开源 pull request 做验证,将文档高度拆成确定性的代码几何与惰性测量的动态评论块两套体系,避免滚动跳变。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。
Google Private AI Compute 团队公布 Private AI Compute 架构更新,将为其平台带来持久、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。
推荐理由:Google 披露 Private AI Compute 的持久化服务端记忆方案,读者可了解云端长期记忆如何与端侧隐私标准结合。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景中的分工。
微软在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式重排序整合两者互补预测,在罕见反应类型召回和专有数据零样本迁移、微调上均通过验证。