过去 12 小时,AI 圈的焦点集中在超大规模开源模型、推理模型和智能体产品:阿里开放 Qwen3.8-2.4T-A95B 权重,微软推出首个自研推理模型 MAI-Thinking-1,Meta 的 Muse Glimmer 也已登陆 OpenRouter。产品侧,Claude in Chrome 侧边栏升级为 Claude Cowork;研究方面,Google 认为前沿模型的事实错误更多来自“想不起”,而非“没学会”。

模型发布/更新

1. 阿里开放 Qwen3.8-2.4T-A95B 模型权重,原生支持 256K 上下文
来源:IT之家(RSS) · 今天凌晨 00:10 · 链接

Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数量达到 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文,并可扩展至 1,010,000 Token。


2. 微软推出首个自研推理模型 MAI-Thinking-1
来源:X:Mustafa Suleyman(Microsoft AI CEO) · 今天凌晨 00:01 · 链接

微软 AI CEO Mustafa Suleyman 宣布,微软首个从零构建的推理模型 MAI-Thinking-1 已在 Microsoft Foundry 上线。官方目前披露的细节有限,但这标志着微软自研基础模型路线进一步落地。


产品发布/更新

3. Claude in Chrome 侧边栏升级为 Claude Cowork 会话
来源:Claude:Blog(网页) · 今天凌晨 04:15 · 链接

Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话。对话会保存至历史记录,技能和连接器可以直接在浏览器中工作,任务也能在桌面、网页和移动端应用之间无缝切换,方便用户持续处理多步骤工作。


4. Meta 开源 Muse Glimmer 登陆 OpenRouter
来源:X:OpenRouter(@OpenRouter) · 昨晚 20:00 · 链接

Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线。这是一款 30B 密集型文本与图像模型,采用 Apache 2.0 许可证,定位是可靠的本地智能体;其 MCP Atlas 得分为 75.5,SWE-Bench Pro 得分为 51.2。


论文研究

5. Google 研究:Recall 可能是参数化事实性的主要瓶颈
来源:Google Research:Blog(网页) · 今天凌晨 01:58 · 链接

Google Research 提出知识画像框架,发现前沿 LLM 的事实编码能力已经接近饱和,但回忆能力仍然不足:多数事实错误更像是“丢了钥匙”,而不是“货架上没有东西”。团队还推出 WikiProfile 基准,包含 2,150 条维基百科事实,每条配有 10 个问题,用于分别检测编码、回忆和识别能力。


技巧与观点

6. AutoGPT 用 AGENTS.md 和技能门控管理 AI 生成的拉取请求
来源:GitHub Blog · 今天凌晨 02:00 · 链接

AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放进 AGENTS.md 和技能文件,并放在代码目录旁边。他们还通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等机制,为智能体提交的 PR 设置门控;其中需要浏览器和 OAuth 流程的 CLA 签名,也被用作区分人类与智能体的“人类探测器”。


7. 长篇非虚构写作仍是 LLM 的短板
来源:Nathan Lambert:Interconnects(RSS) · 昨晚 21:01 · 链接

作者在完成一本 RLHF 教科书后反思,LLM 在长篇非虚构写作上的进展似乎相对停滞。模型擅长改错字和做编辑,但在组织整章内容时仍容易混乱和出错;相比之下,编码、数学等任务已经接近甚至超过人类水平,这种差距可能限制模型自主解决开放科学问题的能力。


今日关键词: Qwen3.8-2.4T-A95B、MAI-Thinking-1、Muse Glimmer、Claude Cowork、事实回忆、AI 智能体、长篇写作