@huxlabi
iAccount based inUnited States!
About this account
- Account based in
- United States
- Connected via
- United States App Store
! X says this location may be affected by a proxy or VPN.
Account-level information from X, not a live location or the device used for a specific post.
👨💻 前阿里技术专家 x 8年大厂技术管理 | AI Builder 🎯 注重Taste,分享AI高质量实践和深度认知
Joined December 2011
- Tweets4.3K
- Following466
- Followers6.5K
- Likes2.4K
别花两年去学怎么当Agent工程师。
吴恩达教授把打法完全摊开来讲。
免费,一个多小时。
大多数人还在一次提问、一次出结果。
他讲的是另一件事:
别指望模型一口说对,让它多跑几圈。
能带走的就这四招:
1. 反思:先写一版,自己挑毛病,再改
2. 工具:不会搜、不会跑代码、不会查库,那就只是会说话
3. 规划:先拆步骤,走偏了再换路
4. 多人协作:调研、执笔、审核分开干,别让一个角色包圆
他反复念叨更土的一件事:
先做评测。看trace,看它到底在哪一步瞎了。
框架换来换去,不如把错误分析做扎实。
同一套模型。差的不是更聪明,是有没有流程。
提示词决定它怎么开口。
流程决定它能不能把活干完。
xAI 刚放出来的这场 GrokBot Workshop,是我今年看过信息密度最高的一小时。
三个工程师,一小时,从零搭出一个能跑的产品。没有产品经理,没有设计师,没有运营。
不是那种"我来演示一下 AI 多厉害"的发布会。
是 Matt Palmer、Lauren Tan 和 Roshan Sadanani 三个人坐下来,打开编辑器,当着你的面从空白项目开始,一步一步把东西做出来。
四个部分,每一段都值单独看:
04:12 — 你的第一个 Bot,从空白到能跑不讲概念,直接上手。怎么定义任务、怎么给上下文、怎么让它出第一个可用的结果。看完这段你就能自己起一个。
28:40 — 怎么把真实工作交给它大多数人卡在这一步:Demo 能跑,但真活不敢交。这段讲的是工程师怎么把自己日常在做的事一件一件拆出去,交给 Bot 干,自己只管验收。
44:25 — 不用产品经理也能推进产品需求整理、优先级排序、进度跟踪:这些传统上需要一个 PM 盯着的事,他们演示了怎么让 Bot 接管。一个工程师带一组 Bot,产品自己往前走。
52:25 — 创始人的 Agent 技术栈最后十分钟是干货最密的部分。从选什么模型、怎么编排多个 Agent、到怎么把这套东西部署上线开始交付,整条链路走了一遍。
三个人,一小时,零到一。
中间没有任何"接下来让我切到准备好的 Demo":全程现场写、现场调、现场出活。
外面卖几百美元的 Agent 工程课,讲的还没这一个小时透。 而且这个全免费。
Anthropic 刚推出的新版 Claude Code Projects真的很不错
AI 编程正在从“人与一个助手反复对话”,
变成“人负责目标和验收,AI 团队并行执行”。
这比单纯提升模型能力更可能改变完整产品的开发方式。
它不再只是整理对话的文件夹,而是一个“总协调者+多条并行任务线程”的开发环境:
你描述最终目标后,Claude 会拆分工作,
让多个完整的 Claude Code 会话分别在独立代码分支上研究、修改、测试和提交 PR,
同时共享项目记忆与文件库。
claude.com/blog/projects-red…
1992年春天,被赶出苹果的第七年,37岁的乔布斯走进麻省理工学院
献上了有史以来录制的最原始、最未经滤镜的60分钟商业大师课。
零公关废话。
讲了整整70多分钟,讲完还在台上跟学生硬碰硬。
整场剥掉客套,真正能带走的就四句话:
1. 别给管理层瞎堆工具。 平庸的公司花钱买软件,净琢磨怎么让总监看汇报更快;真正厉害的公司把预算砸在一线,让干活的人少受折磨。
2. 离开苹果那事,大家都输了。 结局很难看,但别赖在坑里复盘怨气。拍拍灰往前走,日子要过,公司也得往前跑。
3. 手下把事情搞砸了,克制住“替他擦屁股”的冲动。 你冲上去把坑填平只能爽这一个星期;逼着他自己学会爬出来,才能保后面几年。
4. 有分歧别绕弯子。 别搞虚伪的客气,把有冲突的人锁进一间会议室,吵明白、谈透彻,真正达成共识之前谁也别走。
乔布斯后来说,当年被踢出局,学到最痛的一课不是产品,而是人。
一支能磨合十年的铁打班底,比下个季度赶出来的一堆速朽功能值钱得多。
现在看这段视频挺扎心的:
太多人还在疲于奔命修今天的bug,而那个摔在半山腰的乔布斯已经在琢磨:
十年之后,还有谁能跟你背靠背打硬仗?
别花两年去学怎么当Agent工程师。
吴恩达教授把打法完全摊开来讲。
免费,一个多小时。
大多数人还在一次提问、一次出结果。
他讲的是另一件事:
别指望模型一口说对,让它多跑几圈。
能带走的就这四招:
1. 反思:先写一版,自己挑毛病,再改
2. 工具:不会搜、不会跑代码、不会查库,那就只是会说话
3. 规划:先拆步骤,走偏了再换路
4. 多人协作:调研、执笔、审核分开干,别让一个角色包圆
他反复念叨更土的一件事:
先做评测。看trace,看它到底在哪一步瞎了。
框架换来换去,不如把错误分析做扎实。
同一套模型。差的不是更聪明,是有没有流程。
提示词决定它怎么开口。
流程决定它能不能把活干完。
斯坦福刚刚发布了一堂课:
“任何人都能在 60 分钟内跑通自己的第一个 Agent。”
别再对着聊天框死磕提示词了,同行早把 Prompt 封装成了能干活、能落地的自动化系统。
整门课不绕弯子,商业闭环就四步:
Prompt → Agent → 自动化流 → 变现交账。
真正在一线能用上的干货就这四条:
1. 先做出一个会调工具的 Agent:
别整天在对话框里当“词语驯兽师”,让模型能调 API、抓数据、调工具,才是工程上的质变。
2. 零代码也能搞,先跑通闭环再谈优雅:
别一上来就画虚头巴脑的架构图。能把业务逻辑从头到尾串顺、跑出结果,比什么都强。
3. Reasoning 模型的杀招是自主纠偏:
它的厉害之处不是情商高、更会聊天,而是会拆解任务、能边做边自检、发现卡壳懂得主动回溯换路。
4. Agent 根本不是写得更长的大 Prompt:
靠小作文硬撑的叫聊天模板;真正的 Agent 是链式调用、路由分流、并发执行与结果校验死死咬合的系统工程。
大家调的模型底座都差不多。
拉开差距的,是谁先把模型从“聊天界面”里拽出来,按进真实业务的泥坑里干苦力。
会提问的人满大街都是;
能让 AI 自己把脏活累活干完、拿到交付结果的人,才刚开始吃红利。
xAI 刚放出来的这场 GrokBot Workshop,是我今年看过信息密度最高的一小时。
三个工程师,一小时,从零搭出一个能跑的产品。没有产品经理,没有设计师,没有运营。
不是那种"我来演示一下 AI 多厉害"的发布会。
是 Matt Palmer、Lauren Tan 和 Roshan Sadanani 三个人坐下来,打开编辑器,当着你的面从空白项目开始,一步一步把东西做出来。
四个部分,每一段都值单独看:
04:12 — 你的第一个 Bot,从空白到能跑不讲概念,直接上手。怎么定义任务、怎么给上下文、怎么让它出第一个可用的结果。看完这段你就能自己起一个。
28:40 — 怎么把真实工作交给它大多数人卡在这一步:Demo 能跑,但真活不敢交。这段讲的是工程师怎么把自己日常在做的事一件一件拆出去,交给 Bot 干,自己只管验收。
44:25 — 不用产品经理也能推进产品需求整理、优先级排序、进度跟踪:这些传统上需要一个 PM 盯着的事,他们演示了怎么让 Bot 接管。一个工程师带一组 Bot,产品自己往前走。
52:25 — 创始人的 Agent 技术栈最后十分钟是干货最密的部分。从选什么模型、怎么编排多个 Agent、到怎么把这套东西部署上线开始交付,整条链路走了一遍。
三个人,一小时,零到一。
中间没有任何"接下来让我切到准备好的 Demo":全程现场写、现场调、现场出活。
外面卖几百美元的 Agent 工程课,讲的还没这一个小时透。 而且这个全免费。
最近看到一个交易员非常漂亮的打法:
她直接用 Claude 从零搭了一整套能自己选股、下单、盯盘、控仓的交易机器人,
还放出了 23 分钟完整的实战录屏,全程手把手教人复刻。
她最狠的不是让 AI 预测走势,而是把交易逻辑彻底工程化了:
1. 规则写死在 rules.json
5 分钟顺势做多,单笔锁死 1% 风险,最多 5 仓,尾盘强平。规则全在文件里,不给 AI 任何临场脑补的余地。
2. 自动化盯盘循环
盘前扫缺口,盘中 5 分钟跑一轮。先止损、减仓、推保本,把手里仓位管严实了,才看要不要开新仓。
3. 极简实操架构
Claude Code 调盈透 API 跑模拟盘,肉眼彻底解放。手机只收关键推送:建仓、减仓、移动止损、系统报错。
4. 最清醒的实操认知
回测再漂亮(64% 胜率、2.48 盈亏比)也别当真。真实的跳空、滑点、部分成交和主观盘感,回测里全都不存在。
绝大多数人拿大模型炒股,都在逼它预测未来;
而真正懂行的人,是把无聊且反人性的纪律全甩给系统,把真正的逻辑和边界留给自己。
能写代码的模型遍地都是,
但能按你的规则不带情绪跑完一整天的,才叫搭档。
思路可行,能提高效率,但更准确地说,是让 Agent 先消化能自行回答的问题,再把关键决策交给人。
其中有三点不同看法:
1. “BFS 遍历需求树”这个比喻有点太过绝对。
需求对齐不一定逐层进行,也不必遍历所有节点。真正该优先讨论的是不确定性高、答错代价大的问题。
2. Agent 自己反复 grill,不等于与人对齐。
Agent能检查矛盾、补充遗漏、推断已有惯例,但无法凭空知道人的偏好。循环也可能把错误假设越写越完整,形成“内部自洽、方向错误”的 PRD。
3. 最后只审核 PRD,可能会把成本转移到审稿。
文档越长,隐藏假设越难发现。比起只交 PRD,更应该同时交付:已确认事实、待确认假设、需要人拍板的少量问题。
另外还有两个比较重要的点:
1. 影响目标、范围和核心体验的决策,不能由 Agent 默认为已对齐。
2. 通过条件也应从“Agent 认为完全对齐”改成:关键问题都有依据或明确标为待确认,没有未解释的冲突,并达到迭代上限。
最后,这个方法我个人感觉更适合成熟项目里的增量需求。
成熟项目的增量需求通常依据多、未知少、影响范围明确:
1. 已有规则可参考:用户角色、界面风格、数据结构、业务约束都有先例,很多问题查文档和代码就能回答。
2. 需要决定的事情较少:比如给现有系统“增加导出功能”,主要讨论导出哪些内容;从零做一个系统,还要决定服务谁、解决什么问题等。
3. 容易验证和纠正:可以沿用现有流程、测试和验收标准,做错后也更容易局部修改。
反过来,新项目最大的未知往往是用户到底需要什么、产品方向是否正确。
这些需要人的判断和真实用户反馈,Agent 很多时候多循环几轮也无法自行确认。
如果你在用 Grill-Me 对齐需求,给你推荐一种更高效的方式
本质来说,Grill-Me 是人与 Agent 就一棵需求树进行 BFS 遍历对齐,之所以要遍历每个节点,是因为如果人类漏掉一些节点,那“人类理解”与“Agent 实现”之间就会产生偏差。
但逐个节点对齐确实页很耗时间。
你可以针对需求设计一个 AFK循环,让 Agent 对 需求进行 grill 迭代,直到他认为完全对齐
你再对齐产出的 PRD,对不满意的部分进行剪枝并重新对齐
这样能在一定程度上保证 偏差控制 的前提下,极大提高效率
这么做可行的前提是:
1. 项目已经迭代一段时间,有些约定俗成的文档、代码供 Agent 参考
2. AFK循环 的目标、通过条件 设计的合理
卧槽,这个是真牛逼
Hermes作者Teknium泄露了用于清理代码库的神级Prompt
我试用了一下,代码量直接降低30%
建议使用Goal模式,具体Prompt如下:
“我想要一组大规模简化的 PR。或者一个单一的巨型 PR。我希望代码行数(LOC)大幅减少。整体至少 30%。我希望神级文件被拆分。我希望全面简化。我希望统一可重用的辅助函数和方法。我希望减少 if-if-if-if-if-if-else 路由。我希望代码可读性提升。我希望代码库的可解释性和模块间连接关系提升。我希望优雅。我希望清理并移除所有多余的冗余代码。我希望全部完成。没有借口。没有等待我的决定。全都搞定,完成后向我提交一个 PR 或一组 PR。”
感兴趣的可以看原文:
nousresearch.com/refactoring…
Teknium用1,393 个子代理和十九个小时后,代码库缩小了 34.4%,节省了近 200 万美元的工程小时。
马斯克警告说,留给普通人的时间不多了::
最多还有3年的时间,你还能靠“出卖劳动力和时间”换钱的最后窗口期。
3 年之后,绝大多数常规任务都将被 AI 全面接管,花钱买一个人的“工时”,将彻底失去商业逻辑。
工业革命两百年来跑通的核心生存法则:“我给你发薪水,买你的时间”,正在走向终局。
紧随其后的,将是近现代史上规模最庞大的一次财富大洗牌。
嗅觉灵敏的人早就悄悄调头了;
而那些非要等到这事变成铺天盖地的大新闻才后知后觉的人,注定连上桌的机会都没有。
未来的游戏规则极其现实:
商业世界不再看你加了多少班,只看你手里攥着什么资产。
眼下最聪明、性价比最高的下注,既不是死磕买地买房,
也不是跟风盲目抄底加密货币
而是搭起一套由 AI 驱动的自动化现金流系统,即使你躺下睡觉,它也在自动替你运转变现。
摊子不用铺太大:
吃透一项核心技能,打穿一个垂直细分场景,先把每月 1 万美元的闭环彻底跑通。
新手第一周:按天练,不要一天吃 28 条
第 1 天:活下来
安装桌面端,切到 Codex,选 Astra
建一个项目文件夹 codex-lab
让它研究一个你真关心的题目,产出一页摘要
第 2 天:文件工厂
把摘要变成表格
再变成 6–8 页演示文稿
用批注改封面
第 3 天:浏览器验收
做一个超小 GPT Site 或本地页面
强迫它用 browser use 自己点一遍
你再点一遍,对比它漏了什么
第 4 天:接入一个真软件
只接 Gmail 或 Calendar 或 Notion,三选一
完成「总结 + 草稿,不发送」
第 5 天:沉淀一个 Skill
把你最重复的产出格式做成 skill
用两次,改到能交给同事
第 6 天:并行
同一个项目里开 3 条对话:研究 / 设计 / 构建
用 Side Chat 问优先级
建两个 Section 把对话归位
第 7 天:选一条深水
按你的工作选一个:
内容:视频分析 skill + 缩略图生成
产品:本地应用 + Vercel 部署
运营:定时任务 + 邮件摘要
空间:Blender 资产或小游戏
一周目标不是「用过 28 个功能」,而是「有一个项目文件夹里留下真实产物」。
推荐工作流:一个任务从进门到交付
这是视频 implicit 的主循环,比任何单条功能都重要。
1. 选对容器
一次性问题用 Recents;会留下文件用 Project。
2. 选对模型与强度
Astra + 与任务匹配的 reasoning effort。
3. 先给上下文,再给动作
文件、截图、现有链接、约束、成功标准。
4. 要求最小可验证产物
能打开的页面、能下载的表格、能点的按钮。
5. 你自己验收
用浏览器、模拟器、真机或文件预览。不要只读它的「我已经完成」。
6. 用批注或短反馈迭代
圈问题,不要重写整段需求。
7. 需要重复就变成 Skill
第二次做同样的事,就该沉淀。
8. 需要上线再接生产栈
GitHub / Vercel / Convex 或 GPT Sites。
9. 需要长期跑就变成定时任务
并保证那台电脑还活着。
10. 需要并行就开多对话或子代理
不要让一条线程既做研究又做部署又做封面。
本文基于 @rileybrown 2026 年 9 月 14 日发布的近 2 小时课程《28 Insane Things GPT-6 Astra + Codex Can Do》深度整理。目标不是复述口播,而是把视频里每一层操作、每一个限制、每一条可复用工作流,写成一份你可以发给团队任何新人的完整上手手册。
Riley 开场说了一句几乎贯穿整支片子的话:
如果只能留一个 AI 工具,其他全部扔掉,他会留 Codex。
这句话不是营销。他用 Codex 跑了 6 个月创业公司 Agent Native,同时把内容频道做到数百万粉丝。他要解决的问题很具体:怎么让一个团队里「不会写代码的人」和「会写代码的人」,共用同一套界面,把知识工作和软件工作放在同一个地方完成。
所以这支视频的真正目的,不是教你「怎么聊天」,而是教你一件更狠的事:
把 GPT-6 Astra 这个模型,放进一个有文件、有浏览器、有插件、有定时任务、能控制电脑和手机的工作台里。
在继续之前,先记住三个硬区分,后面 28 条都建立在这上面:
Codex 是应用,GPT-6 Astra 是模型。 模型负责思考,应用负责给模型一个能干活的环境。
你要用的不是 chatgpt.com 网页,而是 ChatGPT 桌面客户端里的 Codex 模式。 网页版 ChatGPT、GPT Work(云端办公代理)都不是本指南的主角。
输出不是一段文字,而是你电脑上的真实文件、本地跑起来的应用、能打开的网站、能发出去的邮件。