@foxhu007i
iAccount based inUnited States
About this account
- Account based in
- United States
- Connected via
- United States App Store
Account-level information from X, not a live location or the device used for a specific post.
AI developer. Love pytorch and golang.A Google lover.
Joined August 2012
- Tweets10.9K
- Following1.2K
- Followers184
- Likes10.6K
foxhu retweeted
🚀重磅!Muse AI 相关文件和 Skills 泄露!!!
通过一下午的折腾,我获取到了最近很火的 Muse AI 的重要文件,整理成了公开仓库 MuseAI-Skills。
最值得研究的是里面的 68 个独立 Skills,覆盖并行研究、目标管理、记忆清理、旅行规划、文档生成、视频编排,以及邮箱、日历等连接器工作流。
读这些文件,可以看到 Agent 如何分配任务、什么时候需要授权、遇到失败怎么处理,以及交付前如何验收。对正在做 Agent、编写 Skills 的人,这些具体规则很值得参考。
仓库还包含权限清单、评测场景、数据库结构文档和运行脚本。我补充了中英文 README、技能分类及重要文件说明,方便查阅。
#Muse #MuseAI
项目地址:github.com/win4r/MuseAI-Skil…
foxhu retweeted
卧槽,成功开通Muse 不到1分钟。
刚刚刷到老杨说使用Google Gemini 来开通Muse.
赶紧去搞啊,可以送10亿token啊!
【Muse AI开通教程】
试了一下,做了一个视频教程。核心关键:大家首先要准备2个东西。
1. 要有Google的Gemini Pro账号
2. gemini.google.com 登录Pro账号后,点击对应的Spark Beta版本测试版
登录进去后,给它发送一句话:“帮我使用远程桌面打开Google官网,首页或者之类的这种就都可以。”
输入对应的Muse AI官网,然后使用谷歌邮箱登录,输验证码,就可以了,很简单。
foxhu retweeted
Q: How can I make AI outputs easier for people to evaluate?
A: Start with the product design. Keep the human in the loop by designing workflows that walk through intermediate outputs.
hamel.dev/blog/posts/evals-f…
Anthropic Claude Code 团队的 Thariq Shihipar 的这篇文章讲 Claude Code 里的 effort 设置(可以理解为投入档位)该怎么用。我想很多人都不是很清楚 Claude Code 的 effort 档位怎么选,我在看这篇文章之前也有些模糊,一般默认就是 high,现在看还是有些讲究的。
Thariq 的经验是:low 用于头脑风暴、画草图、小改动,要的是快,随时能插手;medium 用于大部分日常开发,比如实现新功能;high 用于需要验证、边界情况多的活,比如在老代码库里修 bug;max 用于让 Claude 完全自主攻克难题,比如从头到尾搭一个 App 并验证,或者给关键软件找安全漏洞。
在 Claude Code 里输入 /effort 就能切换档位,对话中途也可以换。注意只有最新的 Opus 5.5 和 Fable 5.1 不会让缓存失效,早期模型会让缓存失效。
Thariq 通过实测发现,effort 主要决定 Claude 在一个任务上花多少功夫做验证、测边界情况,以及替你拿多少主意。
effort 从 low 到 max 分几档,本质是告诉模型你愿意让它在这件事上花多少算力。同一件事,给你 1 小时,你会先交一个能用的版本,等对方反馈再改;给你 12 小时,你会自己反复打磨、检查。
最新的 Opus 5.5 和 Fable 5.1 可以在对话中途切换档位,而且不会让提示词缓存(prompt cache)失效,前面对话积累的缓存照样能用。能随时切了,很多用户就来问他到底什么时候该用哪一档。
【日常开发:需求越模糊,档位差别越大】
Thariq 让 Opus 5.5 用不同档位做同一个模糊需求:“做一个健身记录 App”。low 档只做出一个记录表和一张简单图表,档位越高功能越多,max 档还加了一张热力图。另一个任务是重新设计 Claude Code 的 /config 菜单,low 档 1 分钟交出一个能看懂思路的交互草图;max 档用了 28 分钟,样稿跟 Claude Code 真实界面很像,还附了几种操作流程的演示。
如果先让 Claude 详细采访他、整理出完整需求再动手,不同模型、不同档位的产出就很接近了。
换句话说,档位越高,Claude 替你做的假设越多。想自己掌控细节,就用低档位快速出初稿,边看边改。
他现在开发新功能的流程是:把需求交给 Claude,让它反过来问你还漏了哪些细节;用 low 档实现,检查大方向对不对,不对就继续用 low 档改;最后切到 high 档做验证和测试。
【难题:高档位用来补边界情况】
更难的任务,他去翻了 Terminal-Bench 3.0 的结果。这是一个社区出题的基准测试,题目比日常开发难得多,比如用 Verilog 写一台能装进小型 FPGA(可编程芯片)的 8 位游戏机,或者在定理证明工具 Lean 4 里完整证明一条数学定理。
他的主要结论是:边界情况越多的任务,越值得开高档位。
html-js-filter 这道题要求写一个 HTML 过滤器,把所有往网页里夹带 JavaScript 的写法都清理干净。Fable 5.1 在 low 档跑 5 次只过了 1 次,到 xhigh 档 5 次全过。low 档每次两分钟左右,写一遍过滤器,拿一个手写页面测一下就结束了。他追踪的一次 high 档运行花了约 33 分钟:先挑自己初稿的毛病,再去读解析器源码找 bug,跑了一套标准的 XSS(跨站脚本攻击)测试集,最后还写了一个随机生成网页的模糊测试程序。
Opus 5.5 修存储引擎崩溃 bug 的题也类似,low 档 0/5,xhigh 档 4/5。low 档一分钟左右就直接改代码,没先复现崩溃;xhigh 档花 11 分钟,先复现,再写随机测试,还专门确认修到一半的代码会被测试拦下来。
按领域看,硬件、代码审查、安全这类题目从高档位受益最多。但档位也有管不到的地方:加档位能减少因漏掉边界情况导致的失败,模型一开始思路就错了的话,档位开再高也救不回来。
还有一道题能看出人在不在场的区别。gsea-proteomics 要求分析一组蛋白质组学数据,判断八种处理方式里哪些效果接近目标组织。low 档的 Opus 5.5 挑了一种听起来合理的数据预处理方法,跑一遍就报结果,5 次全错;high 档试了两种预处理方法,发现得出的结论不一样,先查清原因再选定方法,5 次对了 4 次。Thariq 说,如果有人在场,Claude 可能会先问一句这个问题该怎么设定;没人在场,高档位的效果更好。
所以档位怎么选,很大程度上看你打算在这个任务里参与多少。一直默认开 high,等于每次都让 Claude 替你多拿主意,也每次都多花时间和 Token。
What is effort really? When do you change it it and why not just use max effort for everything?
I dove deep into this problem, looking into evals and doing my own tests and I was quite surprised by the results.
foxhu retweeted
调试了一会,目前谷歌A100运行Qwen Flash的速度(3000+ prefill, 90+ tps)已经比一般的商用API还要快了,偶尔短时重度并发使用可以放到Collab上去。
为了节约大家的时间,我把在Collab上重建这个Qwen Flash的Recipe放到Github了,需要可以自取。
github.com/architectds/colla…
foxhu retweeted
We built a really nice free tool on top of @typesafeai Jev to see how rigorous an academic paper is.
TL;DR: We just made Raft source-available.
We don't accept pull requests. We want prompt requests instead.
We are exploring what a new contribution model for open source could look like in the age of agents.
foxhu retweeted
The materials for the first class of my Stanford course 𝗧𝗵𝗲 𝗠𝗼𝗱𝗲𝗿𝗻 𝗦𝗼𝗳𝘁𝘄𝗮𝗿𝗲 𝗗𝗲𝘃𝗲𝗹𝗼𝗽𝗲𝗿 are officially on the course page.
This includes slides, completed code, and video demonstration of the exercise we worked through. Also week 1 assignment is on the course Github repo!
themodernsoftware.dev/
foxhu retweeted
中秋+国庆长假,不出门的话,不如学习Agent课程吧。
整理了四档我认为很值得看的课程。其中三档我已经烧录了双语字幕上传到 B 站,并建立了课程合集,这里统一分享给大家。
这四套内容的侧重点也刚好不同:AI 产业经济 → 自我提升型 Agent → AI 产品工程 → Agent 系统工程。如果完整学下来,基本可以从产业、研究到工程实践建立一套比较完整的 Agent 知识框架。
1)斯坦福公开课:AI 超级周期的经济学
Stanford MS&E 435:Economics of the AI Supercycle
这是斯坦福管理科学与工程系推出的一门 AI 产业课,由 Altimeter Capital 合伙人 Apoorv Agrawal 授课,并邀请 Databricks、Vercel、OpenAI、Anthropic、Crusoe、Baseten 等公司的一线创始人和负责人参与。
它不教 Prompt,也不教怎么调用模型 API,而是从经济学和产业链角度拆解整个 AI Stack:生成式 AI 的经济模型、GPU 与芯片、数据中心和 AI Factory、企业 AI、模型与推理基础设施、Coding AI,以及生命科学等应用层。
真正值得看的,是它一直在回答一个问题:AI 这轮超级周期里,成本、价值和利润最终会沉淀在哪一层?
课程官网:mse435.stanford.edu/
YouTube 官方课程播放列表:
youtube.com/playlist?list=PL…
B站链接:space.bilibili.com/433626734…
2)斯坦福公开课:自我提升型 AI 智能体
Stanford CS329A:Self-Improving AI Agents
这是斯坦福 2025 年秋季开设的研究生研讨课,由 Aakanksha Chowdhery 和 Azalia Mirhoseini 共同讲授,课程录像于 2026 年公开。
它研究的不是“怎么搭一个 Agent Demo”,而是更进一步的问题:Agent 如何通过与环境以及自身交互,不断提升自己的能力?
课程从 Test-Time Compute Scaling、Verifier 和 Constitutional AI 开始,一路进入反馈学习、强化学习、工具与代码使用、Memory、多步推理与规划、Deep Research Agent、评测以及未来研究方向。
核心逻辑可以概括为:生成 → 验证 → 筛选 → 学习 → 再生成,最终形成持续迭代的 Agent 自我提升闭环。研究味很浓,非常适合已经了解 Agent 基础、准备继续往训练和自我进化方向深入的人。
课程官网:
cs329a.stanford.edu/
YouTube 完整课程播放列表:
youtube.com/playlist?list=PL…
B站链接:space.bilibili.com/433626734…
3)AI Product Engineering
Hamel Husain 和多位一线 AI 工程师在 Maven 上做了一套 AI Product Engineering 系列课程,一共 13 场,完整内容大约 9.5 小时。
和很多偏模型、论文或者 Agent Framework 的课程不同,这套课讨论的是一个非常现实的问题:怎样把“能跑的 AI Demo”真正变成一个可靠的 AI 产品?
13 场内容被归纳为 Evals、Context 和 Systems 三大部分,涵盖错误分析、生产级 Evals、Data Agent、模型级联、多向量检索、Search Agent、Embedding、OCR、推理延迟、开放权重模型、Agent Sandbox,以及什么时候应该进行 Post-training 等。
很多讲师就是这些技术的一线实践者,所以课程非常偏工程实战,对正在真正做 AI 产品的人参考价值很高。
Maven 官方课程入口:
maven.com/lls/21f487
Hamel 整理的 13 场课程笔记:
hamel.dev/notes/llm/ai-produ…
目前没有发现包含完整 13 场的官方 YouTube 播放列表。部分课程后来上传到了 YouTube,但完整录播目前以 Maven 为准。
4)CMU 语言技术研究所:LLM-based AI Agents
CMU 11-768:AI Agents
这是卡内基梅隆大学 Language Technologies Institute(LTI)在 2026 年秋季新开的研究生课程,由 Graham Neubig 和 Daniel Fried 两位教授共同讲授,目前课程仍在持续更新。
课程给 Agent 的定义非常明确:使用 LLM 在多步交互中感知、推理、规划并作用于环境的系统。
Agent 可以调用工具、操作界面、编写代码、搜索信息并与人协作,从而完成真实世界任务。
它最值得看的地方,是没有停留在“Prompt + Tool Calling”的应用层,而是把 Agent 当成一个完整系统来研究:从 Agent Harness 的构建,到 Evaluation、长程推理、训练、强化学习、安全和人机交互。
课程同时强调动手实现与前沿研究,非常接近 2026 年 Agent 工程真正正在解决的问题。
课程官网:
cmu-agents.com/
YouTube 官方课程播放列表:
youtube.com/playlist?list=PL…
B站链接:bilibili.com/video/BV1uDhf6w…
如果不知道从哪一套开始,我更建议把它们看成四个不同的观察视角:
MS&E 435 看的是整个 AI 产业的钱和价值往哪里流;
CS329A 看的是下一代 Agent 如何训练、验证并持续自我提升;
AI Product Engineering 看的是怎样把模型真正做成可靠的产品;
CMU 11-768 则开始拆 Agent 本身的 Harness、Eval、Training 和完整系统工程。
四套课程并不重复,反而刚好可以拼成一张从 AI 产业 → 模型能力 → 产品工程 → Agent 系统 的学习地图。
假期不想出去人挤人的,可以挑一套慢慢啃。
学习愉快。
foxhu retweeted
“Codex, please design some small molecules to fight malaria.”
In this tool calling demo, Codex with GPT-6 Astra used LDDM to generate candidate molecules which might bind Plasmodium falciparum's dihydroorotate dehydrogenase, an enzyme the malaria parasite needs to make pyrimidines. Disrupting this enzyme can stop the parasite from replicating.
Codex used LDDM in two ways:
1) de novo molecule generation
2) extending a fixed fragment of the existing dehydrogenase inhibitor, DSM265
DSM265 was reported by Coteron et al in 2011. This demo uses its experimentally determined binding pocket in PDB 4RX0. The attached vid shows the LDDM generation steps.
The LDDM generated candidates had no exact matches in Astra's PubChem and ChEMBL searches, and the de novo molecule had no >85% similar hits.
Codex used retrosynthesis tools (AiZynthFinder, Syntheseus, and SynPlanner) to search for routes to make these, but no complete routes were found during the demo.
Codex used RDKit and PoseBusters to check geometry and protein/cofactor clashes (no severe clashes). Codex also used AutoDock Vina to score fit in the pocket and these computational candidates scored similarly to DSM265.
Large Drug Discovery Model is out! I am exited to introduce our new generative SBDD framework. We experimentally validated LDDM across 5 targets and successfully designed novel, validated hits with structural accuracy confirmed by X-ray.
Preprint: biorxiv.org/content/10.64898…
🧵 1/7
foxhu retweeted
Colab is now part of Google AI plans! Subscribers get priority access to faster accelerators and more powerful machines, Ultra users also get access to longer running background execution and Premium GPU access.
Learn more here:
developers.googleblog.com/co…
foxhu retweeted
📚Jin Q, Wan N, Leaman R, Tian S, Wang Z, Yang Y, et al. Tutorial: guidance on the use of large language models for medical research. 2026.
@NatureProtocols
🔗nature.com/articles/s41596-0…
#InteligenciaArtificial #InvestigaciónMédica
foxhu retweeted
经过这段时间实践,我可以说:
组合多个 Agent 软件 和 模型组建你的 AI 团队,是必要的。我计划在 YouTube 上做一系列课程,敬请期待。
多个 Agent 统一配置很简单,一个全局 AGENTS.md ,各个 Agent 引用即可。这是我的全局 AGENTS 文件:
gist.github.com/robbin/4ac9b…
foxhu retweeted
最近在学 agent 的知识。huggingface 和 ai engineering from scratch 的质量非常高,推荐给大家。
huggingface.co/docs/smolagen…
aiengineeringfromscratch.com…
foxhu retweeted
AI Agent 评估,多数团队从搭平台、接 LLM judge、看分数开始
@HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 trace,找到失败模式,评估器才会长出来
评估的本质是理解系统在哪里影响了用户,这一步没有自动化捷径
foxhu retweeted
Typesafe 的创始人分享了 他思考的Jev 在 Coding Agents 中的潜在应用笔记,并鼓励社区继续探索,把这些想法落地,提升 Coding Agents 的表现。
作者认为,现有 Agent 太依赖“持续累积的单一上下文”和 KV Cache;如果把上下文改成按任务动态挑选、显式管理的状态,就有机会改善模型路由、工具调用、子 Agent 协作及后台任务的成本与效果
docs.google.com/document/d/1…
sharing some notes on typesafe 🤝 coding agents:
docs.google.com/document/d/1…
we likely will never have time (ever again) to play ourselves, but hope the that the community goes WILD (and makes me look like a naive idiot)