Mistral 发布 1T 参数多模态模型 Mistral Large 4
法国 AI 实验室 Mistral AI 发布大型多模态模型 Mistral Large 4(昵称 Le Chonk),参数规模达 1 万亿,目前仅通过带护栏的公开端点访问,计划在安全测试完成后三周内开放权重。
法国 AI 实验室 Mistral AI 发布大型多模态模型 Mistral Large 4(昵称 Le Chonk),参数规模达 1 万亿,目前仅通过带护栏的公开端点访问,计划在安全测试完成后三周内开放权重。
Mistral 发布迄今最大模型 Mistral Large 4(ML4),总参数 1 万亿、激活 49B,为原生多模态模型,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型和软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并开放完整微调流程。
Cohere 将企业平台升级为 North 2,用于统一管理 AI 智能体,可自主处理多步工作流并跨会话保留上下文。新版编排系统协调智能体调用共享知识库和可复用技能,并连接 Slack、SharePoint、Jira 等工具,还能在对话中根据文本提示词生成演示文稿、仪表盘和简单应用。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,可通过全托管 API 调用,支持跨区域推理、提示词缓存和服务层级。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与安全测试智能体的完整调用示例,可据此评估托管开源模型的落地方式。
Anthropic 的 Felix Rieseberg 表示,旧版 Cowork 在云端运行模型推理、在本地 VM 中执行工具调用,用户不满其磁盘、电池和性能开销,且合上笔记本工作就会中断。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock,为 ITAR 等受监管工作负载提供 AI 辅助开发通道。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现。
Amazon Quick 控制台不支持将用户从 Admin 直接降为 Reader,或从 Author 直接降为 Reader,update-user API 也会以“You cannot downgrade a user role”报错拒绝。
Amazon Bedrock Managed Knowledge Base 上线智能体检索,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、判断证据是否充分并决定是否再次检索,而 Retrieve API 只做一次混合搜索。
Amazon Quick 的资源跨账户迁移此前需手工重建,AWS 博客给出方案:基于 Amazon Bedrock AgentCore 运行一个幂等的 MCP 服务器 Quick Resource Migrator,单次工具调用即可把 chat agents、action connectors、知识库、flows 和 spaces 从开发账户提升到生产账户。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划全流程。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到每月 $X 额度后直接切断并返回错误,而非仅发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该功能目前仅向有限客户开放;Google Cloud 则在 7 月推出了 Spend Caps。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
MIT Technology Review 报告提出企业 AI 正从工具转向“智能体转型”(agentic shift),核心是实时连接人、流程与数据,并配套治理与控制能力。报告称 2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未靠 AI 实现收入增长。报告建议重建数据基础设施、以可组合架构替代固定技术栈,并解决 AI 主权问题。
亚马逊云科技提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责将自然语言转为固定类型操作调用并转述结果。该模式通过完整性回执断言"合规+违规+模糊+不可读=已扫描",确保 50,000 份跨州租约的审查可证明无遗漏且可辩护,适用于制裁筛查、保险理赔等高风险合规场景。
通过 Amazon Bedrock AgentCore 的 AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数十亿文档,查询流量全程留在 AWS 内、无需外部 API key。
AWS 团队介绍如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,仅调整 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余走默认值。
推荐理由:AWS 团队公开了用 SageMaker AI 多轮 RL 微调搜索智能体的完整配置与四个基准的实测对比,可迁移到自有检索场景。
Airbnb CTO Ahmad Al-Dahle 介绍了公司转向 AI 原生公司的做法:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,单机支持最高 1000 亿参数模型。
推荐理由:原文给出 64GB 新配置的定价、上市时间和双机集群性能数据,可据此判断本地跑大模型的门槛变化。
Earendil 旗下 Pi 发布 Pi 1.0 与 Pi Durable,两者同时登上 Hacker News 首页。Pi 1.0 带来 Codemode(原生支持 MCP、Jev 和图像模型)、虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中系统消息、新 TUI 主题和默认全屏模式。
Chatham Financial 借助 OpenAI 的 Codex 和 GPT-5.6 构建技术并重构工作流程,将交易验证时间从 30 分钟缩短到 4 分钟以内。
GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。
推荐理由:原文给出 Ultrafast 模式相对标准模式的生成速度提升与开放入口,读者可据此判断它对编码智能体循环的实际影响。
AWS Professional Services 基于 Strands Agents SDK 和 Amazon Bedrock AgentCore 构建了四智能体模式,将每应用的基础设施即代码(IaC)开发时间从 3 到 4 周缩短至几分钟,该模式已在 300+ 应用的迁移项目中验证。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开都会实时查询受治理的 Quick Sight 数据集,而非发布时的静态快照,查询以查看者身份执行,自动沿用现有 RLS 和 CLS 规则。
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义记忆后端,为多智能体系统提供持久化记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂 bandit(LinUCB)为产品获客漏斗做个性化内容选择,七周在线 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一个人群则未见改善,问题出在内容而非模型。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):由 Amazon S3 事件或定时任务触发,在 AgentCore Runtime 上以容器方式运行,通过单个 ask_human 工具暂停等待人工审批后继续执行。
NVIDIA 提出 AI 工厂回报取决于产出能力、使用寿命与需求三项,其平台以每兆瓦吞吐量和每 token 成本优化产出,并靠 CUDA 跨代兼容延长硬件寿命。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
Latent Space 在 OpenAI DevDay 后采访了负责 Computer Use 产品与工程的 Ari Weinstein 和 API 产品负责人 Nikunj Handa,讨论 Dots、GPT-6.1 Sol、Agents API 与 Decisions API 等发布。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测与 AE、Dst 指数预报,结合纬度、地质电导率等本地数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,Cognition 成为首个在生产负载上运行该系统的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码负载的算力成本走向。
HPE 提出,当 AI 从试验走向客服、IT、研究等常驻生产负载,按 token 消费的模式会让支出变成难以预测的月度变动项,企业需评估自有算力的盈亏平衡点。Deloitte 2026 企业 AI 报告显示,2025 年员工 AI 使用率上升 5%,至少 40% AI 项目投产的公司比例预计半年内翻倍。
GitHub Copilot 提出,chat 虽是 LLM 的默认交互界面,但多数任务下并非合适 UI,应改用 canvas——一种运行在 GitHub Copilot app 内、无浏览器外壳的全栈应用,可与 agent 双向通信并在本地执行代码。
Remedy Entertainment 的 CONTROL Resonant 已在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪与最高 5K HDR,无需 100GB 本地安装。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力。团队用一个含 2,200 个文件、超百万行改动、400 多条行内评论的开源 pull request 做验证,将文档高度拆成确定性的代码几何与惰性测量的动态评论块两套体系,避免滚动跳变。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个 PR 中增量落地,而非一次性切换。
推荐理由:作者以亲历者身份复盘用 AI 智能体把 Copilot 运行时从 TypeScript 迁到 Rust 的完整过程,给出可迁移的多智能体协作与缓存策略。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进、最准确的全球天气模型,并已接入 Search、Gemini、Google Maps、Google Maps Platform 和 Cloud。
推荐理由:官方给出分辨率、更新频率与降水精度等具体指标,可据此判断 AI 天气预报在 Google 产品中的落地程度。