@huxlab

👨‍💻 前阿里技术专家 x 8年大厂技术管理 | AI Builder 🎯 注重Taste,分享AI高质量实践和深度认知

Joined December 2011
Hux retweeted
别花两年去学怎么当Agent工程师。 吴恩达教授把打法完全摊开来讲。 免费,一个多小时。 大多数人还在一次提问、一次出结果。 他讲的是另一件事: 别指望模型一口说对,让它多跑几圈。 能带走的就这四招: 1. 反思:先写一版,自己挑毛病,再改 2. 工具:不会搜、不会跑代码、不会查库,那就只是会说话 3. 规划:先拆步骤,走偏了再换路 4. 多人协作:调研、执笔、审核分开干,别让一个角色包圆 他反复念叨更土的一件事: 先做评测。看trace,看它到底在哪一步瞎了。 框架换来换去,不如把错误分析做扎实。 同一套模型。差的不是更聪明,是有没有流程。 提示词决定它怎么开口。 
流程决定它能不能把活干完。
1
2
280
这个创意真的不错
110
Hux retweeted
xAI 刚放出来的这场 GrokBot Workshop,是我今年看过信息密度最高的一小时。 三个工程师,一小时,从零搭出一个能跑的产品。没有产品经理,没有设计师,没有运营。 不是那种"我来演示一下 AI 多厉害"的发布会。 是 Matt Palmer、Lauren Tan 和 Roshan Sadanani 三个人坐下来,打开编辑器,当着你的面从空白项目开始,一步一步把东西做出来。 四个部分,每一段都值单独看: 04:12 — 你的第一个 Bot,从空白到能跑不讲概念,直接上手。怎么定义任务、怎么给上下文、怎么让它出第一个可用的结果。看完这段你就能自己起一个。 28:40 — 怎么把真实工作交给它大多数人卡在这一步:Demo 能跑,但真活不敢交。这段讲的是工程师怎么把自己日常在做的事一件一件拆出去,交给 Bot 干,自己只管验收。 44:25 — 不用产品经理也能推进产品需求整理、优先级排序、进度跟踪:这些传统上需要一个 PM 盯着的事,他们演示了怎么让 Bot 接管。一个工程师带一组 Bot,产品自己往前走。 52:25 — 创始人的 Agent 技术栈最后十分钟是干货最密的部分。从选什么模型、怎么编排多个 Agent、到怎么把这套东西部署上线开始交付,整条链路走了一遍。 三个人,一小时,零到一。 中间没有任何"接下来让我切到准备好的 Demo":全程现场写、现场调、现场出活。 外面卖几百美元的 Agent 工程课,讲的还没这一个小时透。 而且这个全免费。
2
2
411
Hux retweeted
史上最全 Codex 完整新手指南 GPT-6 Astra 时代你必须搞懂的 28 件事
4
2
3
480
Anthropic 刚推出的新版 Claude Code Projects真的很不错 AI 编程正在从“人与一个助手反复对话”, 变成“人负责目标和验收,AI 团队并行执行”。 这比单纯提升模型能力更可能改变完整产品的开发方式。 它不再只是整理对话的文件夹,而是一个“总协调者+多条并行任务线程”的开发环境: 你描述最终目标后,Claude 会拆分工作, 让多个完整的 Claude Code 会话分别在独立代码分支上研究、修改、测试和提交 PR, 同时共享项目记忆与文件库。 claude.com/blog/projects-red…
1
200
1992年春天,被赶出苹果的第七年,37岁的乔布斯走进麻省理工学院 献上了有史以来录制的最原始、最未经滤镜的60分钟商业大师课。 零公关废话。 讲了整整70多分钟,讲完还在台上跟学生硬碰硬。 整场剥掉客套,真正能带走的就四句话: 1. 别给管理层瞎堆工具。 平庸的公司花钱买软件,净琢磨怎么让总监看汇报更快;真正厉害的公司把预算砸在一线,让干活的人少受折磨。 2. 离开苹果那事,大家都输了。 结局很难看,但别赖在坑里复盘怨气。拍拍灰往前走,日子要过,公司也得往前跑。 3. 手下把事情搞砸了,克制住“替他擦屁股”的冲动。 你冲上去把坑填平只能爽这一个星期;逼着他自己学会爬出来,才能保后面几年。 4. 有分歧别绕弯子。 别搞虚伪的客气,把有冲突的人锁进一间会议室,吵明白、谈透彻,真正达成共识之前谁也别走。 乔布斯后来说,当年被踢出局,学到最痛的一课不是产品,而是人。 一支能磨合十年的铁打班底,比下个季度赶出来的一堆速朽功能值钱得多。 现在看这段视频挺扎心的: 太多人还在疲于奔命修今天的bug,而那个摔在半山腰的乔布斯已经在琢磨: 十年之后,还有谁能跟你背靠背打硬仗?
283
Claude Code 的工程师刚刚发布了一段 28 分钟的极其干货视频,内容堪比黄金: “如何编写提示词以获得极佳的结果。” 我之前看过 500 美元的课程,甚至连他前 10 分钟讲的内容都比不上。 从CLAUDE.md 文件、记忆快捷方式、并行会话,以及几乎没人使用的提示模式…… 全都在这段28分钟视频中。 完全免费。没有废话。 无论你是开发者、刚入门AI, 还是已经使用 Claude 好几个月了, 从今天起将改变你的游戏规则。 赶紧保存。今天就观看。
1
1
3
362
别花两年去学怎么当Agent工程师。 吴恩达教授把打法完全摊开来讲。 免费,一个多小时。 大多数人还在一次提问、一次出结果。 他讲的是另一件事: 别指望模型一口说对,让它多跑几圈。 能带走的就这四招: 1. 反思:先写一版,自己挑毛病,再改 2. 工具:不会搜、不会跑代码、不会查库,那就只是会说话 3. 规划:先拆步骤,走偏了再换路 4. 多人协作:调研、执笔、审核分开干,别让一个角色包圆 他反复念叨更土的一件事: 先做评测。看trace,看它到底在哪一步瞎了。 框架换来换去,不如把错误分析做扎实。 同一套模型。差的不是更聪明,是有没有流程。 提示词决定它怎么开口。 
流程决定它能不能把活干完。
1
2
280
斯坦福刚刚发布了一堂课: “任何人都能在 60 分钟内跑通自己的第一个 Agent。” 别再对着聊天框死磕提示词了,同行早把 Prompt 封装成了能干活、能落地的自动化系统。 整门课不绕弯子,商业闭环就四步: Prompt → Agent → 自动化流 → 变现交账。 真正在一线能用上的干货就这四条: 1. 先做出一个会调工具的 Agent: 别整天在对话框里当“词语驯兽师”,让模型能调 API、抓数据、调工具,才是工程上的质变。 2. 零代码也能搞,先跑通闭环再谈优雅: 别一上来就画虚头巴脑的架构图。能把业务逻辑从头到尾串顺、跑出结果,比什么都强。 3. Reasoning 模型的杀招是自主纠偏: 它的厉害之处不是情商高、更会聊天,而是会拆解任务、能边做边自检、发现卡壳懂得主动回溯换路。 4. Agent 根本不是写得更长的大 Prompt: 靠小作文硬撑的叫聊天模板;真正的 Agent 是链式调用、路由分流、并发执行与结果校验死死咬合的系统工程。 大家调的模型底座都差不多。 拉开差距的,是谁先把模型从“聊天界面”里拽出来,按进真实业务的泥坑里干苦力。 会提问的人满大街都是; 能让 AI 自己把脏活累活干完、拿到交付结果的人,才刚开始吃红利。
1
336
xAI 刚放出来的这场 GrokBot Workshop,是我今年看过信息密度最高的一小时。 三个工程师,一小时,从零搭出一个能跑的产品。没有产品经理,没有设计师,没有运营。 不是那种"我来演示一下 AI 多厉害"的发布会。 是 Matt Palmer、Lauren Tan 和 Roshan Sadanani 三个人坐下来,打开编辑器,当着你的面从空白项目开始,一步一步把东西做出来。 四个部分,每一段都值单独看: 04:12 — 你的第一个 Bot,从空白到能跑不讲概念,直接上手。怎么定义任务、怎么给上下文、怎么让它出第一个可用的结果。看完这段你就能自己起一个。 28:40 — 怎么把真实工作交给它大多数人卡在这一步:Demo 能跑,但真活不敢交。这段讲的是工程师怎么把自己日常在做的事一件一件拆出去,交给 Bot 干,自己只管验收。 44:25 — 不用产品经理也能推进产品需求整理、优先级排序、进度跟踪:这些传统上需要一个 PM 盯着的事,他们演示了怎么让 Bot 接管。一个工程师带一组 Bot,产品自己往前走。 52:25 — 创始人的 Agent 技术栈最后十分钟是干货最密的部分。从选什么模型、怎么编排多个 Agent、到怎么把这套东西部署上线开始交付,整条链路走了一遍。 三个人,一小时,零到一。 中间没有任何"接下来让我切到准备好的 Demo":全程现场写、现场调、现场出活。 外面卖几百美元的 Agent 工程课,讲的还没这一个小时透。 而且这个全免费。
2
2
411
OpenAI是真的听劝啊 心心念念已久的功能 最新版ChatGPT客户端 浏览器终于支持安装Chrome扩展程序了 以后做自动化操作更方便了
1
1
233
最近看到一个交易员非常漂亮的打法: 她直接用 Claude 从零搭了一整套能自己选股、下单、盯盘、控仓的交易机器人, 还放出了 23 分钟完整的实战录屏,全程手把手教人复刻。 她最狠的不是让 AI 预测走势,而是把交易逻辑彻底工程化了: 1. 规则写死在 rules.json 5 分钟顺势做多,单笔锁死 1% 风险,最多 5 仓,尾盘强平。规则全在文件里,不给 AI 任何临场脑补的余地。 2. 自动化盯盘循环 盘前扫缺口,盘中 5 分钟跑一轮。先止损、减仓、推保本,把手里仓位管严实了,才看要不要开新仓。 3. 极简实操架构 Claude Code 调盈透 API 跑模拟盘,肉眼彻底解放。手机只收关键推送:建仓、减仓、移动止损、系统报错。 4. 最清醒的实操认知 回测再漂亮(64% 胜率、2.48 盈亏比)也别当真。真实的跳空、滑点、部分成交和主观盘感,回测里全都不存在。 绝大多数人拿大模型炒股,都在逼它预测未来; 而真正懂行的人,是把无聊且反人性的纪律全甩给系统,把真正的逻辑和边界留给自己。 能写代码的模型遍地都是, 但能按你的规则不带情绪跑完一整天的,才叫搭档。
2
1
1
582
思路可行,能提高效率,但更准确地说,是让 Agent 先消化能自行回答的问题,再把关键决策交给人。 其中有三点不同看法: 1. “BFS 遍历需求树”这个比喻有点太过绝对。 需求对齐不一定逐层进行,也不必遍历所有节点。真正该优先讨论的是不确定性高、答错代价大的问题。 2. Agent 自己反复 grill,不等于与人对齐。 Agent能检查矛盾、补充遗漏、推断已有惯例,但无法凭空知道人的偏好。循环也可能把错误假设越写越完整,形成“内部自洽、方向错误”的 PRD。 3. 最后只审核 PRD,可能会把成本转移到审稿。 文档越长,隐藏假设越难发现。比起只交 PRD,更应该同时交付:已确认事实、待确认假设、需要人拍板的少量问题。 另外还有两个比较重要的点: 1. 影响目标、范围和核心体验的决策,不能由 Agent 默认为已对齐。 2. 通过条件也应从“Agent 认为完全对齐”改成:关键问题都有依据或明确标为待确认,没有未解释的冲突,并达到迭代上限。 最后,这个方法我个人感觉更适合成熟项目里的增量需求。 成熟项目的增量需求通常依据多、未知少、影响范围明确: 1. 已有规则可参考:用户角色、界面风格、数据结构、业务约束都有先例,很多问题查文档和代码就能回答。 2. 需要决定的事情较少:比如给现有系统“增加导出功能”,主要讨论导出哪些内容;从零做一个系统,还要决定服务谁、解决什么问题等。 3. 容易验证和纠正:可以沿用现有流程、测试和验收标准,做错后也更容易局部修改。 反过来,新项目最大的未知往往是用户到底需要什么、产品方向是否正确。 这些需要人的判断和真实用户反馈,Agent 很多时候多循环几轮也无法自行确认。
如果你在用 Grill-Me 对齐需求,给你推荐一种更高效的方式 本质来说,Grill-Me 是人与 Agent 就一棵需求树进行 BFS 遍历对齐,之所以要遍历每个节点,是因为如果人类漏掉一些节点,那“人类理解”与“Agent 实现”之间就会产生偏差。 但逐个节点对齐确实页很耗时间。 你可以针对需求设计一个 AFK循环,让 Agent 对 需求进行 grill 迭代,直到他认为完全对齐 你再对齐产出的 PRD,对不满意的部分进行剪枝并重新对齐 这样能在一定程度上保证 偏差控制 的前提下,极大提高效率 这么做可行的前提是: 1. 项目已经迭代一段时间,有些约定俗成的文档、代码供 Agent 参考 2. AFK循环 的目标、通过条件 设计的合理
4
2
517
卧槽,这个是真牛逼 Hermes作者Teknium泄露了用于清理代码库的神级Prompt 我试用了一下,代码量直接降低30% 建议使用Goal模式,具体Prompt如下: “我想要一组大规模简化的 PR。或者一个单一的巨型 PR。我希望代码行数(LOC)大幅减少。整体至少 30%。我希望神级文件被拆分。我希望全面简化。我希望统一可重用的辅助函数和方法。我希望减少 if-if-if-if-if-if-else 路由。我希望代码可读性提升。我希望代码库的可解释性和模块间连接关系提升。我希望优雅。我希望清理并移除所有多余的冗余代码。我希望全部完成。没有借口。没有等待我的决定。全都搞定,完成后向我提交一个 PR 或一组 PR。”
1
3
435
感兴趣的可以看原文: nousresearch.com/refactoring… Teknium用1,393 个子代理和十九个小时后,代码库缩小了 34.4%,节省了近 200 万美元的工程小时。
194
马斯克警告说,留给普通人的时间不多了:: 最多还有3年的时间,你还能靠“出卖劳动力和时间”换钱的最后窗口期。 3 年之后,绝大多数常规任务都将被 AI 全面接管,花钱买一个人的“工时”,将彻底失去商业逻辑。 工业革命两百年来跑通的核心生存法则:“我给你发薪水,买你的时间”,正在走向终局。 紧随其后的,将是近现代史上规模最庞大的一次财富大洗牌。 嗅觉灵敏的人早就悄悄调头了; 而那些非要等到这事变成铺天盖地的大新闻才后知后觉的人,注定连上桌的机会都没有。 未来的游戏规则极其现实: 商业世界不再看你加了多少班,只看你手里攥着什么资产。 眼下最聪明、性价比最高的下注,既不是死磕买地买房, 也不是跟风盲目抄底加密货币 而是搭起一套由 AI 驱动的自动化现金流系统,即使你躺下睡觉,它也在自动替你运转变现。 摊子不用铺太大: 吃透一项核心技能,打穿一个垂直细分场景,先把每月 1 万美元的闭环彻底跑通。
1
1
3
587
史上最全 Codex 完整新手指南 GPT-6 Astra 时代你必须搞懂的 28 件事
4
2
3
480
新手第一周:按天练,不要一天吃 28 条 第 1 天:活下来 安装桌面端,切到 Codex,选 Astra 建一个项目文件夹 codex-lab 让它研究一个你真关心的题目,产出一页摘要 第 2 天:文件工厂 把摘要变成表格 再变成 6–8 页演示文稿 用批注改封面 第 3 天:浏览器验收 做一个超小 GPT Site 或本地页面 强迫它用 browser use 自己点一遍 你再点一遍,对比它漏了什么 第 4 天:接入一个真软件 只接 Gmail 或 Calendar 或 Notion,三选一 完成「总结 + 草稿,不发送」 第 5 天:沉淀一个 Skill 把你最重复的产出格式做成 skill 用两次,改到能交给同事 第 6 天:并行 同一个项目里开 3 条对话:研究 / 设计 / 构建 用 Side Chat 问优先级 建两个 Section 把对话归位 第 7 天:选一条深水 按你的工作选一个: 内容:视频分析 skill + 缩略图生成 产品:本地应用 + Vercel 部署 运营:定时任务 + 邮件摘要 空间:Blender 资产或小游戏 一周目标不是「用过 28 个功能」,而是「有一个项目文件夹里留下真实产物」。
1
123
推荐工作流:一个任务从进门到交付 这是视频 implicit 的主循环,比任何单条功能都重要。 1. 选对容器 一次性问题用 Recents;会留下文件用 Project。 2. 选对模型与强度 Astra + 与任务匹配的 reasoning effort。 3. 先给上下文,再给动作 文件、截图、现有链接、约束、成功标准。 4. 要求最小可验证产物 能打开的页面、能下载的表格、能点的按钮。 5. 你自己验收 用浏览器、模拟器、真机或文件预览。不要只读它的「我已经完成」。 6. 用批注或短反馈迭代 圈问题,不要重写整段需求。 7. 需要重复就变成 Skill 第二次做同样的事,就该沉淀。 8. 需要上线再接生产栈 GitHub / Vercel / Convex 或 GPT Sites。 9. 需要长期跑就变成定时任务 并保证那台电脑还活着。 10. 需要并行就开多对话或子代理 不要让一条线程既做研究又做部署又做封面。
1
43
本文基于 @rileybrown 2026 年 9 月 14 日发布的近 2 小时课程《28 Insane Things GPT-6 Astra + Codex Can Do》深度整理。目标不是复述口播,而是把视频里每一层操作、每一个限制、每一条可复用工作流,写成一份你可以发给团队任何新人的完整上手手册。 Riley 开场说了一句几乎贯穿整支片子的话: 如果只能留一个 AI 工具,其他全部扔掉,他会留 Codex。 这句话不是营销。他用 Codex 跑了 6 个月创业公司 Agent Native,同时把内容频道做到数百万粉丝。他要解决的问题很具体:怎么让一个团队里「不会写代码的人」和「会写代码的人」,共用同一套界面,把知识工作和软件工作放在同一个地方完成。 所以这支视频的真正目的,不是教你「怎么聊天」,而是教你一件更狠的事: 把 GPT-6 Astra 这个模型,放进一个有文件、有浏览器、有插件、有定时任务、能控制电脑和手机的工作台里。 在继续之前,先记住三个硬区分,后面 28 条都建立在这上面: Codex 是应用,GPT-6 Astra 是模型。 模型负责思考,应用负责给模型一个能干活的环境。 你要用的不是 chatgpt.com 网页,而是 ChatGPT 桌面客户端里的 Codex 模式。 网页版 ChatGPT、GPT Work(云端办公代理)都不是本指南的主角。 输出不是一段文字,而是你电脑上的真实文件、本地跑起来的应用、能打开的网站、能发出去的邮件。
1
2
182