Microsoft 研究:AI 评测如何暴露传统 benchmark 之外的“意外失败”
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。
OpenAI 发文探讨先进 AI 对突破性创意背后日常工作的价值,认为执行环节可能决定下一轮经济的形态与进步速度。文章未给出具体模型、参数或评测数据。
NVIDIA 提出 AI 工厂回报取决于产出能力、使用寿命与需求三项,其平台以每兆瓦吞吐量和每 token 成本优化产出,并靠 CUDA 跨代兼容延长硬件寿命。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
GitHub Copilot 提出,chat 虽是 LLM 的默认交互界面,但多数任务下并非合适 UI,应改用 canvas——一种运行在 GitHub Copilot app 内、无浏览器外壳的全栈应用,可与 agent 双向通信并在本地执行代码。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 专业知识,后者是智能体连接工具和数据的标准,二者可组合使用;RAG 并未消亡,检索能让模型基于训练数据外的文档、内部知识和代码库上下文作答,减少 token 浪费和不完整回答。
伯克利 AI 研究发文指出,GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间、中位数约 50x。作者提出近乎免费推理带来的三大数据系统挑战:为智能体设计的数据系统、运行智能体集群的数据系统,以及由智能体合成数据系统。