跳到正文
今天10月7日周三1 条
  1. Microsoft Research22

    Microsoft 研究:AI 评测如何暴露传统 benchmark 之外的“意外失败”

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月6日周二
8月13日周四
  1. Microsoft Research42

    MindTopo:微软研究院推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo,一个评估多模态大语言模型拓扑推理能力的基准,覆盖连通性、分离、顺序、包围和绳结五类拓扑关系,并区分静态推理与交互规划两个认知层级。测试显示,当前专有与开源模型在静态识别上明显强于交互规划,且均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步操作时仍不可靠。