Simon Willison:按量付费服务需要默认硬性预算上限,AWS 已推出支出限额
Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到每月 $X 额度后直接切断并返回错误,而非仅发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该功能目前仅向有限客户开放;Google Cloud 则在 7 月推出了 Spend Caps。
Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到每月 $X 额度后直接切断并返回错误,而非仅发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该功能目前仅向有限客户开放;Google Cloud 则在 7 月推出了 Spend Caps。
MIT Technology Review 报告提出企业 AI 正从工具转向“智能体转型”(agentic shift),核心是实时连接人、流程与数据,并配套治理与控制能力。报告称 2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未靠 AI 实现收入增长。报告建议重建数据基础设施、以可组合架构替代固定技术栈,并解决 AI 主权问题。
NVIDIA 提出 AI 工厂回报取决于产出能力、使用寿命与需求三项,其平台以每兆瓦吞吐量和每 token 成本优化产出,并靠 CUDA 跨代兼容延长硬件寿命。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
HPE 提出,当 AI 从试验走向客服、IT、研究等常驻生产负载,按 token 消费的模式会让支出变成难以预测的月度变动项,企业需评估自有算力的盈亏平衡点。Deloitte 2026 企业 AI 报告显示,2025 年员工 AI 使用率上升 5%,至少 40% AI 项目投产的公司比例预计半年内翻倍。
GitHub Copilot 提出,chat 虽是 LLM 的默认交互界面,但多数任务下并非合适 UI,应改用 canvas——一种运行在 GitHub Copilot app 内、无浏览器外壳的全栈应用,可与 agent 双向通信并在本地执行代码。
伯克利 AI 研究发文指出,GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间、中位数约 50x。作者提出近乎免费推理带来的三大数据系统挑战:为智能体设计的数据系统、运行智能体集群的数据系统,以及由智能体合成数据系统。
伯克利 AI 研究团队发布综述,系统梳理并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文章对比了自一致性、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!