跳到正文
今天10月8日周四4 条
  1. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量级 Agentic RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量级 Agentic RL 框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的同一 agent harness 直接参与强化学习,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 3500 行代码的 Agent RL 框架,读者可了解用真实 harness 训练智能体的轻量方案与实测增益。

  2. The Verge · AI36

    Meta 的 AI 智能体 Muse 登陆 iPad

    Meta 的 AI 智能体 Muse 通过最新 iOS 更新加入对 iPad 的原生支持,可更好利用大屏与 iPadOS 多任务能力。此次更新还让 Muse 接入 Canva、Dropbox、Figma、GitHub、Zoom、Asana、Notion 等工具,并支持为小企业主设定业务目标以自主规划营销与客户提案。

10月7日周三
  1. AWS Machine Learning Blog42

    Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 基于 Amazon Bedrock 和开源智能体编排框架 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统还把手动生命周期步骤从 10 步以上压缩为 1 次交互(减少 70%),并将冗余告警中位数削减 65%,由三人团队在六个月内交付。

  2. TechCrunch · AI62

    Google Labs 推出 AI 游戏创作平台 Playground

    Google Labs 推出 AI 游戏创作平台 Playground,用户用简单文本提示即可构建浏览器游戏,无需编程经验。创作者可选择问答、竞速等类型,指定 2D 或 3D、单人或多人对战,并描述玩法机制与视觉风格,还可上传素材由 AI 转化为符合整体美术风格的游戏资产。

  3. The Verge · AI62

    DoorDash 警告餐厅警惕 AI 点餐平台 Bites

    DoorDash 向湾区多家餐厅发出警告邮件,称它们可能在不知情的情况下被列入 AI 点餐平台 Bites,并提示这可能违反部分州法律。Bites 主打在 ChatGPT 内直接下单、订单直达餐厅,每单仅收 1 美元附加费,其创始人称有 14 家餐厅合作伙伴收到了 DoorDash 的信。

  4. TechCrunch · AI58

    Hark 发布主打隐私的 AI 个人助理 Hark Pro

    初创公司 Hark 正式发布 AI 个人助理 Hark Pro,用户可免费使用,重度用户可订阅付费。该产品基于专门为电脑操作训练的模型,可接入邮件、日历、硬盘和信用卡等数字生活数据,代为完成数字任务,并以小窗口展示智能体浏览网页的过程以建立信任。Hark 称其目标不是做应用,而是为未来的 AI 电脑打造操作系统,并计划在 2027 年推出配套的 AI 原生设备。

  5. Microsoft Research22

    Microsoft 研究:AI 评测如何暴露传统 benchmark 之外的“意外失败”

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动当前 AI 系统突破性能边界,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月6日周二
  1. Simon Willison28

    Simon Willison 测试 Claude Opus 5.5 创作游戏音乐

    Simon Willison 让 Claude Opus 5.5 设计文本音乐格式并构建可播放的 artifact,要求达到《猴岛小英雄》初代配乐水准,结果意外更贴近猴岛主题且质量出乎意料地好。他猜测文本模型作曲能力可能类似此前的 3D 图形能力,是近几个月才涌现的新能力,但需用其他新旧模型做实验才能确认。

  2. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,可通过全托管 API 调用,支持跨区域推理、提示词缓存和服务层级。

    推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与安全测试智能体的完整调用示例,可据此评估托管开源模型的落地方式。

  3. TechCrunch · AI66

    Reflection 发布开源权重模型 Beam,对标中国开源模型

    Reflection AI 发布首个前沿开源权重模型 Beam,称其在高级推理基准上与中国领先开源模型持平,且推理算力消耗低 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练使用 23.8 万亿 token,上下文窗口 100 万 token。公司称本月将公开模型权重和完整技术细节,并通过超大规模云厂商和 neocloud 分发。

  4. TechCrunch · AI60

    TikTok 推出 AI 购物助手与一键结账

    TikTok 周一宣布推出 AI 购物助手和站内一键结账功能,用户可直接在品牌处下单。该购物助手是对话式 AI 智能体,能理解上下文并记住用户偏好,提供商品详情、物流、尺码、库存和完成购买等实时导购。新功能与 Salesforce、Shopify、Shoplazza、Stripe 等商务和支付平台合作搭建,用户可在 For You 信息流中一键购买。

  5. AWS Machine Learning Blog34

    Amazon SageMaker AI 推出 aws-ai-ml 技能,为 Kiro、Claude Code、Codex 等编码智能体提供生成式 AI 推理优化能力

    Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。

  6. TechCrunch · AI22

    两姐妹推出 Hot Girl Hotline:面向年轻女性的 AI 情感建议应用

    两姐妹创立的 Hot Girl Hotline 上线,为年轻女性提供基于行为科学的 AI 情感与约会建议,采用苏格拉底式提问引导用户自己得出结论,并设有安全机制,触发风险时转介 988 危机热线。该应用月订阅费 9.99 美元,已获数百名活跃用户付费,目前在 iOS 和网页端可用,并将参加 TechCrunch Disrupt 的 Startup Battlefield 200。