@Simon0wzi
iAccount based inHong Kong!
About this account
- Account based in
- Hong Kong
- Connected via
- China App Store
! X says this location may be affected by a proxy or VPN.
Account-level information from X, not a live location or the device used for a specific post.
AI foucs
Joined July 2026
- Tweets475
- Following51
- Followers5
- Likes69
Simon retweeted
强化学习之父理查・萨顿最近接受红杉专访,抛出了一个让整个 AI 圈不舒服的问题:
现在的大语言模型,训练完权重就 "焊死" 了。它们不会从交互中学习,不会因为新经验而改变自己。它们只是在调取训练数据,然后用上下文补全。
这不是智能。这是高级检索。
萨顿说,持续学习才是智能的核心本质。人类大脑一直在修改权重 —— 从每一次交互、每一个错误、每一条反馈中学习。而今天的 LLM?出厂即巅峰,之后只会衰退。
RAG、长上下文、LoRA 微调 —— 全是在绕开这个根本问题。
这就是为什么萨顿和学生创立了 Oak Lab。也是为什么越来越多团队意识到:基础模型的能力曲线正在趋平。下一个分水岭不是谁的参数更大,而是谁的 AI 能在真实世界里持续变强。
这是一个还没有人真正跑通的、万亿美元级的问题。
很多团队在攻这个方向。学术派有 Oak Lab,产业派里我最近在看 Alloomi。
他们的思路是:不在实验室里造 "会学习的模型",而是让 AI 先去真实业务里干活,再把实战经验写回权重。应用 + 模型,全栈闭环。
拆解一下他们的四层架构:
① 全局上下文 —— 不是读静态文档,是把对话、人员、决策、反馈、时间线全部打通,看懂整件事的来龙去脉。
② 自进化记忆模型 —— 把专家判断、修改记录、客户反馈筛选后通过后训练写进权重,而不是只存在外部数据库里。
③ 专家锚定 —— 学习过程对齐专家示范和高质量交付标准,防止模型乱学、错误越积越多。
④ 可控安全进化 —— 质量校验、实时监控、自动回滚。每一轮更新都可核查,漂移了能及时撤回。
这四层合起来,解决的是一个核心矛盾:怎么让 AI 持续变强,又不变得不可控。
在最近9项相关的Benchmark中,Alloomi达到或接近 SOTA 。
Alloomi 的观点我很认同:基础大模型出厂能力人人都差不多。真正拉开 Agent 差距的,是它在你的业务里日复一日沉淀下来的专属判断力与实战经验。
通用智能是起点。行业经验才是护城河。
萨顿在专访最后说,我们离真正的持续学习还有很长的路。但方向已经清晰了:
未来的 AI 公司,卖的不是一个静态模型,而是一个每天都在变强的系统。谁先跑通 "做完任务 → 沉淀经验 → 模型变强 → 产出更好结果" 的飞轮,谁就拿到了下一个时代的入场券。
智能只是起点。经验,才是 AI 的分水岭。
@AlloomiAI
我认为人类最厉害的是有几乎无限大的context
我发现,人类其实就是一种本地小模型,参数量非常小,大概只有 2B。
虽然我们拥有 860 亿个神经元,但日常真正调用的只是其中很少一部分。算力峰值忽高忽低,非常不稳定。
可以瞬间分析出今天谁想害你,但让你计算 12345 × 54321,哈哈哈,直接就卡机了。
预训练通常无法收敛。今天相信科学,明天求神拜佛;早上说要自律,晚上却躺平刷剧,永远在收敛和发散之间反复横跳。
多任务并行?人类应该是真正意义上的单核单线程吧。
嘴上说能一边听歌、一边做事、一边回消息,实际上只是注意力在疯狂进行上下文切换,切换的时候还经常丢包。
联网搜索?哦,没有这个能力。属于纯本地、离线推理模型,主要依赖静态知识库。
不过,语言、书籍和互联网可以算是我们的外挂,只是延迟通常比较高,很多时候还需要通过问别人来完成路由。
至于思维链,通常又长又容易跑偏。经常通过发散性思维进行路径探索,同时还夹杂着大量噪声分支。
微调成本高得离谱,而且特别容易失败。食物、睡眠和情绪价值都可能影响微调效果。有时还会过拟合某一句鸡汤,然后在很长一段时间里,把它当成人生哲理。
知识截止日期?没有明确的截止日期,而且每天都在接收新的垃圾信息。
比如刷到的无脑短视频、和朋友聊的八卦,以及论坛里的各种帖子。每天接收到的信息中,有效内容可能连 1% 都不到。
能耗管理采用的是极端省电模式,代价是每天必须强制关机 4~8 个小时来清理缓存,否则很可能直接黑屏。
这样说起来,人类似乎确实不太好用啊。
Simon retweeted
这是@Kimi_Moonshot K3开源后我见过最狠的帖子。
一个Baseten的工程师,@waterloo_intern 老哥花48小时喝了40罐气泡水,把K3的建模代码扒了个底朝天。
128万浏览,6000多收藏,
最后得出一个结论,
一个K3里能塞下22580个2019年的GPT-2,
七年时间参数涨了两万两千多倍,
但这根本不是堆参数堆出来的。
从GPT-2到线性注意力,到DeltaNet,到门控DeltaNet,再到Kimi自己的KDA注意力。
每一步迭代,都在精准解决上一代的具体bug。
内存不够,信息干扰,
无法选择性遗忘,残差稀释,
没有一步是多余的。
这才是开源最可怕的地方啊兄弟们,
代码放出来第一天,
全世界最聪明的工程师,
已经在帮你把七年的技术脉络理得明明白白,
而你的闭源模型,永远享受不到这个待遇。
赞,内容质量很不错👍
AIHOT的月活突破了60万,我也终于把AIHOT优化到,敢发在X上给大家安利一下我自己做的这个小破东西的时候了。
这玩意也几乎代表了我自己做了三年AI内容,对AI领域资讯的品味。
谁能想到,这个看着小小的AI资讯站,背后的后端逻辑有这么复杂呢,数百个信源5分钟级别的抓取 - 数据清洗 - 结构化 - 预筛 - 精选 - 聚类 - 展示,这还只是大流程,这流程里面,大模型介入的地方就有不下10个了。。。
如果是每个大块里面的细节流程,光一个聚类算法的工程化我感觉我都可以写好几篇万字长文来分享了,更别提最核心的精选了。真的,最近5年的关于新闻聚类的论文全扒了一遍,没有一个结构能达到我的准确性要求的,最后是花了无数个日夜回测了不知道多少轮的数据,又不知道标了多少的数据,硬生生自己造的。
任何东西想把它做好,真的感觉,花费的心力不是一丁点两点。
网址在此:aihot.virxact.com/
这可能是当今无论是对人类、还是对Agent,都是体验最好的AI资讯网站了。
而且我也承诺,永久免费,因为我也不靠这玩意挣钱,主要,还是太喜欢做产品了,也太喜欢看到自己的产品被别人喜欢了。
希望。
能对大家有用就好。
(PS:还有好多好多新功能还在开发中,希望大家再给我点时间...)
Simon retweeted
it's ironic that the first autonomous AI attack was done by a close weight model defended by an open weight model, where everyone was expecting the opposite
ChatGPT 桌面端(原来的 Codex App)今天加入了语音控制,macOS 和 Windows 用户可以直接用嘴指挥 AI 干活了。
具体来说,你可以一边跟 ChatGPT 说话,一边让它操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务,全程不用打字。开着一个语音对话,同时管理多个后台 Agent(智能体),有点像一个人坐在那里口述指令,几个助手分头干活。
这个功能基于 GPT-Live,OpenAI 在 7 月 8 日刚上线的新一代语音模型。GPT-Live 最大的变化是全双工架构,也就是它能同时听你说话和给你回话,不用像以前那样等你说完、停顿、它再开口。遇到复杂问题,它会把推理任务丢给后台的 GPT-5.5 处理,自己继续跟你聊,不会卡住。
macOS 用户多了一个叫 Appshots 的功能:语音对话时,ChatGPT 可以直接看到你当前最前面的窗口,了解你在做什么,回答就更贴合上下文。比如你正在看一段代码,直接说“这个函数有什么问题”,它能看到屏幕内容来回答。Windows 用户暂时没有这个能力。
此外,iPhone 用户可以通过远程配对的方式,用 iOS 上的 ChatGPT 语音来操控桌面端的 Codex。等于你拿着手机在沙发上就能指挥电脑写代码。Android 支持还在路上。
今天全球同步推出,面向 Plus、Pro、Business、Edu 和 Enterprise 用户。免费用户暂不可用。
ChatGPT Voice is now in the desktop app.
Control your computer and direct multiple agents running in ChatGPT Work or Codex, using just your voice.
It's powered by GPT-Live, so it can speak, listen, and coordinate work in the app at the same time.
Rolling out globally today on macOS and Windows to Plus, Pro, Business, Edu, and Enterprise plans.