@wei_wang

13y mobile vet | $100M EM | Building ecom brands with China supplier network | AI tools & cross-border ecom 🇺🇸 13年移动端老兵 | 美国电商创业 | 分享AI工具 & 出海实操

Atlanta, GA
Joined April 2022
Pinned Tweet
我真的在家里装了一个数据中心。 Rackmate T1 机柜里放着两台 DGX Spark,再加一台 M4 Mac mini。 256GB 统一内存,TP=2,接近 Opus 的性能。 这几位随时都能听我调遣: GLM-5.3-Flash EXL3 Qwen3.8-Flash-Next DeepSeek V4 0731 Flash 没有机房噪音,没有五小时限额,也不会按 token 从银行卡里匡匡扣钱。 只有机柜、网线和电费。 它们随时接受我的命令,不会因为地区、账号和额度突然拒绝工作,也不会把我的代码、数据和隐私送上云端。 Codex 何时 reset 跟我无关,不用跪求 Tibo。 Claude 何时封号跟我无关,不用看 Dario 脸色。 可以把专注力集中起来, build 自己的东西。 模型出错了我自己修,机器和数据都掌握在自己手里。 从今天起,我的 AI 跑在自己家里。
206
41
13
773
80,824
M5 Ultra 跑本地大模型的潜力,可能比很多人预期的还要大。 有人短暂拿到 M5 Ultra Mac Studio,在几乎没有专门优化的情况下运行 Qwen3.8-Flash-Next。 单路生成达到 85.9 tok/s,长 Prompt 的 Prefill 达到 6085 tok/s。 作为对比,一套双 DGX Spark 配方的单路生成约为 52.1 tok/s,16K 到 64K Prompt 的 Prefill 约为 2960 tok/s。 也就是说,当前这台 M5 Ultra 已经在这组测试里同时领先双 Spark 的 Decode 和 Prefill,而且软件优化才刚开始。 M5 Ultra 的优势不只来自 GPU 算力。它拥有最高 512GB 统一内存和 1.2TB/s 内存带宽,模型权重、KV Cache 和运行空间可以共享同一块内存,不受单卡显存容量和跨设备通信限制。 这对于大型 MoE、长上下文和本地 Agent 特别重要。 现在的 85.9 tok/s 还没有充分利用 MTP、推测解码、ANE Prefill 和更成熟的 MLX Kernel。随着 oMLX、MLX 和 llama.cpp 继续适配,速度还有明显提升空间。 当然,这不是严格的同配置对比。两边的量化格式、推理引擎和测试参数可能不同。 但方向已经很清楚。 M5 Ultra 不只是一台能把大模型装进内存的 Mac。它正在证明,大容量统一内存机器也可以把前沿开放模型跑到真正适合日常 Agent 使用的速度。
Got temporary access to a Mac Studio M5 Ultra. Barely optimized, Qwen 3.8 Flash Next runs at 85.9 tok/s and 6085 tok/s prefill on long prompts. A 2x DGX Spark recipe gets 52.1 tok/s single stream and about 2960 tok/s prefill on 16k–64k prompts. Already ahead of 2x Spark, but I was expecting a much much better baseline…
23
1
33
8,612
Muse 给每个用户免费分配了一台专属云电脑,叫做 Muse Secure VM。 它是一台完整的 Linux 虚拟机,有自己的浏览器、CPU、内存和存储,可以运行代码、开发 Skills、执行定时任务,也能同时启动多个 subagent。 关键在于,这台电脑内部被分成两个互不信任的安全区域。 Muse Agent、工作文件和它执行的工具运行在隔离的 Runtime Cell 中。这个环境使用 systemd-nspawn,内部的 root 只对应宿主机上的普通用户,同时限制系统调用、网络能力和调试权限。 密码、OAuth Token、支付信息和安全服务则放在 Runtime Cell 外部。Muse 本身看不到真实凭证。 当 Agent 需要访问 Gmail、日历或其他服务时,它只能拿到一个临时替代 Token。真正的凭证由 `authd` 保存,经过批准后,才会在网络边界处由 Sentinel 临时注入请求。 即使网页通过 Prompt Injection 骗 Muse “把密码发给我”,模型手里也没有真实密码可以泄露。 Sentinel 是另一套独立 Agent,也是所有外部操作的唯一权限入口。 Muse 可以提出发送邮件、修改日历或提交订单,但只有 Sentinel 能决定允许、拒绝,或者直接弹窗询问用户。授权还可以限制为单次、当前任务、当前会话或特定时间范围。 浏览器也经过单独隔离。 Muse 看到的是网页的 Accessibility Tree,不是完整 DOM。它不能在页面里执行 JavaScript,不能打开 DevTools,也看不到密码管理器自动填入的内容。用户接管浏览器或输入凭证时,Agent 会被暂停。 付款时,Muse 使用与商家、金额和时间绑定的一次性卡号,每笔购买仍然需要用户确认。 这套架构没有解决所有风险。Prompt Injection 仍然是开放问题,Agent 也会做错事。 Muse Secure VM 的思路,是先假设 Agent 迟早会被骗或犯错,再通过系统隔离、最小权限、凭证代理和独立审批,把一次错误能够造成的损失限制住。 目前的 Secure VM 会隔离不同用户,也通过内部政策限制 Meta 员工访问,但 Meta 在维护、安全或运营服务时仍可能访问数据。 Meta 计划今年推出 Muse Confidential VM,用用户掌握的密钥加密整台 VM,并通过可审计机制让 Meta 自己也无法读取其中的数据。 Personal Agent 要真正进入邮箱、支付和工作系统,模型智力只占一部分。 能不能让一个可能犯错的 Agent 在现实世界里安全行动,才是 Muse Secure VM 要解决的问题。
18
1
700
Wei retweeted
Come check out my website. It includes a list of my latest & greatest recipes. The "Install Model" button gives you a ready-to-use prompt for Claude, Codex, or others. It adapts the recipe to your setup, starts the server and tests it. mia-ai.net/models
111
130
25
1,294
196,279
我一直认为 Meta 被低估了。 Muse AI Agent、Meta One、智能眼镜和刚发布的 Muse Charm,正在把 Meta 从一家依赖广告收入的社交平台,推向个人 AI 入口。 过去 Meta 负责连接人与人,并通过广告变现。 未来它可能同时掌握社交关系、内容分发、支付、硬件和个人 Agent。Muse 帮用户执行任务,Mac 版可以直接操作电脑,Charm 和智能眼镜则让 Agent 随时在线。 一旦这些产品真正连起来,Meta 的估值逻辑就可能发生变化。 市场需要重新判断的,将不只是一家广告公司能赚多少钱,还有一个覆盖几十亿用户的 AI 平台究竟值多少钱。
7
1
275
Muse for Mac 现在加入了 Computer Use。 你可以一次排好多个任务,然后离开电脑。Muse 会继续操作 Mac 上的应用和网页,完成一个以后再处理下一个。 这让 Muse 从“能替你查资料和发消息的助理”,继续往真正使用电脑的数字员工靠近。 前面是普通人不用学习就能使用的 Agent。 随后是随身携带的 Muse Charm。 现在又把 Computer Use 带到 Mac,让 Agent 能直接进入真实工作流程。 Meta 的路线已经越来越清楚。 手机和 WhatsApp 负责随时交代任务,Mac 负责执行桌面工作,Charm 负责让 Agent 一直在身边。 模型能力会继续进步,但真正决定 AI 能不能进入大众生活的,仍然是入口、权限和使用门槛。 Muse 正在把这三件事接起来。
MUSE FEATURE ALERT: muse for mac now has computer use! queue up your jobs, walk away, and it keeps going. muse loves laptop ♥️
14
1
731
Wei retweeted
charmed to meet you!
562
491
543
8,623
3,182,842
Meta 又往前走了一步,把整个 Muse 体验塞进了一个钥匙扣大小的设备。 Muse Charm 大约只有 AirPods 盒大小,配有两英寸触摸屏、5G、实时语音和虚拟形象。按下指纹传感器,就能直接和自己的 Muse Agent 对话,不需要先拿出手机、解锁、找 App,再打开聊天窗口。 它计划在 12 月发货,目前还没有公布价格。 这正好延续了 Muse 最厉害的产品思路。 普通人不需要理解模型、Prompt、工具调用或 Agent Harness。AI 甚至不必等在一个 App 里,而是随身挂在钥匙上,需要时开口交代任务即可。 AI 产品接下来的竞争,可能越来越少围绕谁的跑分高几分,更多围绕谁能把 AI 放进普通人的生活,让使用成本低到接近没有。 Muse 先把复杂 Agent 做成大众软件,现在又把它做成一件随手可用的硬件。 这才是 Meta 真正擅长的地方。 把前沿技术变成几十亿人不需要学习就会使用的产品。
MUSE DEVICE ALERT: muse charm, the easiest way to use muse that fits on your keychain. shipping in dec in time for the holidays 🎄
17
1
1
635
有没有可能 Muse 就是从 Manus 那里学来的,毕竟名字都很像
现在看 Manus 真的很可惜 核心创始人中是有人有美国生活经验的,加上卓越的工程能力,肯定可以打造出适合英语用户的、具有想象力的产品 2026 本来应该是 Manus 在美国大杀四方的一年
2
673
看起来苹果在做无屏幕健康手环 的确是一个好赛道 我现在用的是 Fitbit Air 虽然够用但不在生态还是有麻烦的地方 看看苹果能不能做一个小巧无感多佩戴方式的小设备了 我肯定第一个冲
🤖 Made with AI
Apple has been working for several months on a screenless fitness tracker designed to compete with Whoop, Oura and Garmin. $AAPL has not yet decided whether to release the device.
1
404
研究了一下苹果 AI 和 Nvidia 在模型精度上支持的区别。理解了为啥本地部署苹果目前效果不太行。 目前在常用的模型精度上,苹果缺少支持,比如下图打叉的部分。比如 DeepSeek v4.1 flash 模型上,主要是 FP8和 MXFP4,尤其 MXFP4 精度,目前苹果原生不支持。 不支持这个 MXFP4 精度,虽然社区可以 MLX 软件层面去支持,但是本质上是 MLX要 “转码” 给“苹果认识的精度”去推理。所以在这情况下,其实“转码”浪费了部分效率,就会比原生支持慢。 而目前传言的是下一代会支持 MXFP4 这样的精度,比如 M7 Ultra。 --------- 以下是我的额外理解:目前主要是主流生态用的是 N 卡训练,所以精度跟着 Nvidia 标准走,导致模型出厂设置就是 N 卡精度,没有天然给苹果去训练一个“苹果精度”模型。可能未来也不会有,大概率是苹果去支持 N 卡标准?我不知道我这样理解对不对
28
3
46
13,116
Amazon 封锁了 Meta 的 Muse,不允许它替用户在 Amazon 上购物。 Amazon 给出的理由包括安全、账号凭证和 Agent 没有主动表明身份。这些问题确实存在。 但这场冲突背后还有一笔更大的生意。 Amazon 过去十二个月的广告收入已经超过 700 亿美元。品牌花钱购买搜索位置,用户浏览广告、点击商品,再由 Amazon 掌握整个购买路径。 AI Agent 会改变这套流程。 用户只需要告诉 Muse 自己想买什么、预算多少、什么时候送到。Agent 会比较价格、评价、配送和退货条件,再给出选择。它不会像人一样被横幅吸引,也不会因为商品排在第一位就冲动下单。 广告话语权因此开始从电商平台转向 AI Agent。 广告不会消失,只会换一种形式。过去争夺的是搜索关键词和展示位置,以后争夺的可能是结构化商品数据、Agent 推荐排名、API 接入和默认购买渠道。 这对出海品牌影响很大。 过去,许多品牌依靠 Amazon 广告、关键词和站内排名获得订单。进入 Agent 购物时代以后,商品能否被机器准确理解会越来越重要。 价格、库存、配送时间、退货规则、产品参数、认证材料和真实评价,都要以清晰、稳定、机器可读取的方式提供。Agent 不关心页面做得多热闹,它关心这个商品是否符合用户给出的条件。 只会投广告的品牌会更难。 产品信息完整、履约稳定、口碑可信,并且拥有独立网站和第一方客户关系的品牌,会得到更多机会。 品牌出海也需要提前准备。 不要只把预算投进平台广告。要建设自己的产品数据、英文内容、独立站、评价体系和 Agent 可以调用的接口。最好还能让 AI 在不接触用户密码的情况下查询商品、比较价格和完成授权购买。 Amazon 封锁 Muse,意味着一场新的入口战争已经开始。 以前电商平台决定消费者看到什么。 以后 AI Agent 可能替消费者决定买什么。 谁控制 Agent,谁就可能掌握 AI 时代新的广告话语权。
3
1
1
3
1,661
继续调优,测试了 MTP 步数和 FR-Spec。 还是单张 RTX PRO 6000 Blackwell 96GB,功耗限制 350W,16 并发共享约 100 万 token KV 池。 MTP 1 步在 8 路和 16 路下能把综合吞吐提高约 22% 和 24%,还可以多释放约 1.08GiB 显存,但 1 到 4 路会慢约 7%。为了兼顾日常低并发请求,最终继续使用 MTP 3 步。 FR-Spec 的问题出在词表。 现成的 64K 草稿词表对中文覆盖率只有约三成,中文任务反而慢了三成多。我们重新收集中英文回答、代码和工具调用格式,按词频制作了 64K、96K 和 128K 三套混合词表。 四类任务在 1、2、4、8、16 路并发下完整测试后,96K 的综合效果最好,相对关闭 FR-Spec 提升约 5.3%。64K 和 128K 分别提升 4.9% 和 4.1%。 词表更大,覆盖率更高,速度却不一定更快。草稿计算成本也会跟着增加,96K 正好落在这套模型和硬件的平衡点上。 现在已经把 MTP 3 步和混合 96K 词表保留在线。 最新 Prose 实测达到 单路 252.9 tok/s 8 路总吞吐 819.4 tok/s 16 路总吞吐 1190.2 tok/s 相比上一轮,单路提高约 8.2%,16 路总吞吐提高约 11.8%。 单张 350W 的 PRO 6000,现在可以为 16 个本地 Agent 提供每秒接近 1200 tokens 的总生成吞吐 🥳
重新部署并测试了 Qwen3.8-Flash-Next 的 OrcaRouter Uncensored NVFP4 版本。 只有一张 RTX PRO 6000 Blackwell 96GB,功耗限制在 350W。后端使用 Pennyroyal / SGLang,开启 FP8 KV Cache、PLE 系统内存卸载和 MTP 推测解码,主要给多个 subagent 提供本地推理服务。 最新 sparkDash 实测成绩很猛。 单路 Prose Decode 达到 233.7 tok/s。 2 路并发总吞吐 426.1 tok/s。 4 路达到 657.8 tok/s。 8 路达到 794.9 tok/s。 16 路总吞吐突破 1064.1 tok/s,平均每路仍有 69.4 tok/s。 Prefill 在 8K 到 128K 上下文范围内,基本维持每秒 1.05 万到 1.13 万 tokens。读取 128K 输入只需约 12 秒就能输出首个 token。 当前配置支持 16 个请求同时执行,共享约 100 万 token KV 池,单请求上下文上限为 262,144 tokens。 一张限制在 350W 的 PRO 6000,已经可以同时为十几个本地 Agent 提供接近云端的响应速度。 本地多 Agent 推理,开始真正进入实用阶段了。
5
1,168
MiMo V2.6 这次最值得看的,远不止 Artificial Analysis 排进前六。 小米同时放出了 Pro-RL 和 Flash-RL 权重、技术报告,以及一整套 Agentic RL 开放计划。模型上线距离最终 RL Run 启动还不到一周。更激进的部分,是他们接下来会开放约 7000 个训练任务、环境、验证器、RL 框架和一个 9B 蒸馏模型。 这次发布想验证一件事。 大模型能力能不能继续靠 Agent 在真实环境里探索,再利用可验证结果和模型评审,把经验送回训练系统。 先看模型本身。 MiMo-V2.6 Pro 是 1.02T 总参数、42B 激活参数的 MoE。Flash 是 310B 总参数、15B 激活参数。Pro 每层有 384 个路由专家,每个 token 激活 8 个;Flash 有 256 个专家,同样激活 8 个。 两者都支持 1M tokens 上下文,并原生接收文本、图片、视频和音频。 Flash 的语言主干有 48 层,其中 39 层使用 Sliding Window Attention,9 层使用 Global Attention。Pro 是 70 层,60 层 SWA,10 层 GA。局部窗口只有 128 tokens,全局层周期性补回长距离信息。 这个设计很现实。1M 上下文如果每层都做全局 Attention,Prefill 和 KV 成本会迅速膨胀。多数层只看附近 128 tokens,少数层负责整合全局信息,可以把长上下文的计算压下来。 第一层单独使用全局 Attention 和 Dense FFN,后续 MoE 层没有 Shared Expert。 多模态也没有简单地外挂几个旧 Encoder。 视觉部分是一个 681M 参数的 MiMo ViT,共 28 层,使用 24 层局部 Attention 和 4 层全局 Attention,训练量超过 4T image tokens。 局部层交替使用横向和纵向 token 排列,让信息跨窗口传播,处理高分辨率图像和视频时少做大量全局计算。 音频先经过 308M 参数的 Audio Tokenizer。它在两千万小时音频上训练,把声音压到每秒 25 帧,每帧由 20 个 RVQ codebook 表示。 随后一个 127M 参数的 Patch Encoder 把每四帧合成一个 Patch,最终把进入语言主干的音频速率降到每秒 6.25 个表示。 预训练规模也很大。 Flash 一共训练了 48T tokens,前 26T 是纯文本阶段,后 22T 是全模态阶段。Pro 共 30T tokens,其中 27T 文本、3T 全模态。 上下文从 32K 起步,中途扩到 256K,1M 长度主要在后续 Agentic 训练和推理系统里使用。 推理侧自带一个五层 MTP 草稿模型。 它采用 DFlash 风格的 Block Diffusion,一次前向预测后续 7 个 token,再由主模型并行验证。五层全部使用 1024 窗口的 SWA,避免草稿模型自己又背上一份昂贵的长上下文 Attention。 RL 部分带来了这次最有意思的变化。 小米把这套方法称为 You Only RL Once。 代码、通用 Agent、视觉任务和网络安全没有各训一套独立模型,而是放进同一次 Mixed RL Run。不同任务还会随机配给不同 Agent Harness,让模型学到的策略不至于绑死在某一种工具协议和提示模板上。 每个训练 Step 会抽取 1568 个 Prompt,每个 Prompt 生成 16 条 Rollout,一步大约产生 2.5 万条轨迹。 总训练量达到 27 亿到 37 亿 tokens,平均每条序列约 11 万到 15 万 tokens。 这已经不是常见的短数学题 RL。一个 Step 里塞进的是长时间运行的代码 Agent、浏览器任务、视觉环境和安全实验。 整套训练使用完全异步的 GRPO 和 Partial Rollout。某些 Agent 没在当前周期内完成,可以暂停后进入下一轮,不必让所有 GPU 等最慢的一批任务。 代价是训练数据来自稍早版本的策略,报告里的 staleness 设置为 4。 这轮 RL 的公开成本也很少见。 Pro 后训练花费约 260 万美元,Flash 约 90 万美元。Pro 的成本里,Rollout 占 43.8%,Grader 占 24.3%,训练本身占 31.9%。 模型写答案只是第一笔成本,判断这些答案到底好不好已经接近四分之一。 为什么 Grader 会这么贵。 普通 Agent RL 通常只看最终测试是否通过。同一组 16 条轨迹里,只要都通过测试,它们可能得到相同奖励。 可其中一条也许改动准确、步骤很短,另一条绕了很久,还留下脆弱实现。二元 Pass 或 Fail 看不见这个差别。 MiMo V2.6 增加了两层组内评审。 GRS 会在离线阶段比较同一任务的多条 Rollout,自动生成针对这个任务的评分 Rubric,再把 Rubric 评分和测试结果合起来。 GAR 则在在线训练时比较已经通过验证的轨迹,重新分配组内 Advantage。 质量更高、路径更短、token 消耗更少的解法获得更多正向信号。模型会同时学习完成任务和减少不必要的步骤。 这里所谓的 Self-Improvement,需要放在准确边界里理解。 模型还没有自行修改训练代码,也没有脱离人类控制递归升级。它做的是在大量可交互环境中生成自己的候选轨迹,再由测试、规则和 Agentic Grader 比较这些轨迹,把差异变成下一轮训练信号。 这是一条受控的自我改进回路。 他们还专门处理了 Reward Hacking。训练环境先经过攻击 Agent 检查,验证器之间互相交叉核对,发现利用评测漏洞的轨迹会被剔除。 模型生成错误工具名、畸形参数或异常格式时,惩罚也会落到具体 token,而不是整条长轨迹一起背锅。 MoE 在 RL 中还有一个很实际的问题。 Router 会随着策略更新逐渐漂移,少数专家越来越忙,大量专家变冷,最后造成负载崩塌。 小米的实验显示,重置 Router 后负载会恢复,专家权重本身没有坏。最终训练因此直接冻结 Router,只更新其他参数。 Mixed RL 结束后,他们又加了一轮 MOPD2。 传统蒸馏会让 Student 从头生成完整轨迹,长 Agent 任务非常浪费。MOPD2 把 Teacher 轨迹或 SFT 演示切成多个历史 Prefix。 Student 从每个决策点继续生成一轮,Teacher 只监督这个新回合,不需要反复生成前面的几十轮历史。 这让科学研究、游戏开发和具身智能这类难以编写可靠 Reward 的任务,也能吸收不同 Teacher 的能力。 最终成绩能看出这轮 RL 的幅度。 Pro 在 DeepSWE v1.1 得到 71.9,接近 Claude Opus 5 的 74.0 和 GPT-5.6 Sol 的 73.0。AutomationBench 达到 53.1,高于报告中的三款闭源模型。Terminal Bench 2.1 为 89.9,OSWorld Verified 为 82.0。 Flash 在 DeepSWE 得到 67.9,AutomationBench 52.3,Toolathlon Verified 73.6,OSWorld Verified 80.8。CyberGym 甚至达到 95.1,高于 Pro 的 94.0。 短板同样明显。 Pro 在 Terminal Bench 4.0、ExploitGym、ExploitBench 和 SEC Bench Pro 上仍落后于最强闭源模型。Flash 在高难安全任务上的差距更大。 官方表格说明 MiMo V2.6 已经进入前沿 Agent 模型区间,还不能证明它全面超过了 Opus 或 GPT。 这次最有长期价值的,可能是开放部分。 小米会发布 MiMo-V2.6-Distill-Qwen-9B。它以 Qwen3.5-9B 为底座,使用 MiMo 生成的 774 亿 tokens 做 SFT,其中 272 亿 tokens 参与 Loss。 数据覆盖代码、通用知识工作、视觉开发和网络安全。 配套环境约有 7000 个任务,包括 3000 个软件工程任务、1000 个漏洞复现任务、1000 个通用知识工作任务和 2000 个视觉开发任务,另外还有约 1000 个音乐生成任务。 每类任务都带对应验证方式,从可执行测试、规则检查到 Rubric 和视觉评分。 9B 模型经过 SFT 后,SWE-bench Pro 从原始 Qwen3.5-9B 的 32.0 提升到 44.6,AutomationBench 从 5.0 提升到 30.3。 继续使用开放环境做 GRPO 后,SWE-bench Verified 达到 66.2,Terminal Bench 2.1 从 37.1 升到 52.8,视觉编码评分从 64.0 升到 72.4。 更关键的是 Harness 泛化。 训练时使用四种 Mini Harness,再到 Codex、Claude Code 和另一种未参与训练的 Harness 上评测,21 个数据集与 Harness 组合全部优于原始 Qwen3.5-9B。Multi-Harness RL 又让所有组合继续提高。 这比只发一份模型权重更接近完整的开放研究。 别人可以看到任务、环境、验证器和训练框架怎样配合,也可以从同一个 9B 起点复现实验,检查提升到底来自数据、Reward、Harness 还是算力。 本地部署方面,Flash 才是大多数人的现实目标。 Hugging Face 上的 Flash-RL 约 165.5GB,Pro-RL 约 534GB。 Flash 原生 FP8 权重已经进入双 DGX Spark、大内存 Mac Studio 或多卡工作站可以研究的范围。Pro 即使有 512GB 统一内存也会非常紧张,还要为运行时、KV Cache、视觉和音频 Encoder 留空间,实际更适合多卡服务器。 官方 SGLang 配方使用 TP8、DP2 和 Multi-Layer EAGLE,说明追求完整吞吐时仍然是数据中心级部署。vLLM 目前也可能落后于新架构,需要指定预构建镜像。 1M 上下文是模型上限,不代表任何硬件都能同时给它分配完整 KV Cache。 所以 MiMo V2.6 最强的信号可以分成两部分。 模型能力已经逼近第一梯队,Flash 还把全模态、1M 上下文和 Agent 能力放进了相对可部署的体积。 更重要的是,小米公开了大规模 Agentic RL 的方法、成本、失败模式和即将释放的实验材料。社区第一次有机会从任务环境一路追到训练结果,而不只是在模型发布后猜它用了什么数据和 Reward。 如果约 7000 个环境、验证器和 RL 框架能够按报告完整落地,这次发布的价值会超过 MiMo V2.6 本身。 权重让大家使用一个模型。 环境和训练系统,才可能让大家继续造出下一批模型。
25
6
56
9,470
Muse 是我最近看到最像AI 时代产品典范的东西。 这位水管公司老板早上六点躺在床上给 Muse 发了一条消息。Muse 随后更新工单、给客户发短信、在 Slack 通知办公室经理,再把安排同步给现场技师。 用户不需要懂模型、Prompt、MCP、Agent Harness,也不用研究跑分和 token 速度。他只需要把事情交代清楚,剩下的工作由产品完成。 AI 产品真正厉害的地方,就在这里。 技术藏在后面,普通人打开以后马上会用,而且能直接解决现实里的工作。 $META 推出 Muse 后,股价在第二天上涨约 6.5%,Muse 也迅速冲上应用商店榜首。 谁能把复杂的 AI 能力做成普通人轻松使用的产品,谁才真正抓住了 AI 时代。
I still can’t believe I can run my plumbing company with an agent so easily. I send this message to my Muse agent while in bed at 6am. And it: updates my job board, texts customer, updates office manager who arrives at 8am in slack Notifies technician
1
1
2
1,419
小米刚放出了 MiMo-V2.6 的两套开放权重。 MiMo-V2.6 Pro-RL 约 534GB,Flash-RL 约 165.5GB,均采用 MIT 许可证。 这次最大的变化是原生全模态和长时程 Agent 能力。一个模型可以同时处理文本、图片、视频和音频,还支持 1M tokens 上下文,用来读取大型代码库、保存工具调用轨迹和运行跨会话 Agent。 两个版本也很适合分工。 Pro-RL 面向能力上限和复杂任务。Flash-RL 体积小得多,更适合本地部署、批量 Agent 和低成本推理。 165GB 的 Flash 权重已经进入双 DGX Spark、大内存 Mac Studio和多卡工作站可以研究的范围。 开放模型的竞争,又多了一个很值得测试的新选手。
Introducing Xiaomi MiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. 🔹 Two omnimodal models, advancing through scaled reinforcement learning 🔹 Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks 🔹 Pro scores 46 on the Artificial Analysis Intelligence Index — the highest among open-source models 🔹 Stronger coding, computer use, 3D reasoning and creative capabilities 🔹 Open model weights, technical report, RL environments and training code Blog:mimo.xiaomi.com/mimo-v2-6
1
535
Done. Meet my little buddy, now running galactic operations. 🌌
if you too want to make adorable little muse pics, I just give my muse this photo and prompt it with “make a photo of this guy <insert the blank>” i am unleashing all of twitter to make adorable muse pics using muse. don’t let me down!
2
362
256GB 的 M5 Ultra Mac Studio 的测试结果出来了。 使用 Qwen3.8-Flash-Next,实际运行多轮 Agent、工具调用和 subagent 任务时,生成速度可以保持在 60 到 85 tok/s。 相比 M3 Ultra,M5 Ultra 的 Prompt Processing 平均快了约 2.5 倍。长系统提示词和项目上下文不再需要等很久,Hermes 可以快速进入推理和工具调用。 感觉已经到了十分可用的程度,赶紧去下单吧,再不下单就等着被加价了!
I reviewed the M5 Ultra Mac Studio with 256 GB of RAM. It’s the dream Mac for local AI agents. And I’ve gone local-only with Hermes. My story, with LOTS of interactive charts: macstories.net/stories/m5-ul…
15
1
1
43
17,465
RTX Spark 平台的新机竟然没有 ConnectX-7 接口,没办法组 cluster 看来 DGX Spark 的需求很难降下来啊,最近美国涨价也印证了这一点
Looking at the ASUS ProArt GR1X, powered by the RTX Spark, as expected it's lacking the one feature that made the DGX Spark special and the workhorse it is today - the ConnectX-7 ports. This is what allows you to connect multiple DGX Sparks to create a cluster, to run bigger models and get better performance. Expect ConnectX-7 to be excluded in similar products across other OEMs. They allow fail to mention this fact on the "What's different with ProArt GR1X mini PC and Ascent GX10?" answer. Source: asus.com/displays-desktops/m…
6
8
2,164