@ClorisSignali
iAccount based inUnited States
About this account
- Account based in
- United States
- Connected via
- United States App Store
Account-level information from X, not a live location or the device used for a specific post.
Silicon Valley AI researcher & data scientist 🌱 Decoding frontier AI through data, eval, strategy & a human lens. Build • Invest • Connect
SF Bay Area
Joined March 2024
- Tweets467
- Following238
- Followers2.4K
- Likes801
Pinned Tweet
最近跟国内做 FDE 的朋友聊到项目交付,却很少谈 Eval。
OpenAI 已把 eval-driven feedback 写进 FDE 的成功标准,Anthropic 也把 Eval 视为 Agent 的核心工程。这篇文章想聊聊为什么要做 Eval,还会完整演示如何从 0 到 1 搭建一套可用的 Agent Evaluation Framework~
昨晚去 AI 健康教练平台 ViiRaa 的朋友们主办的 Body Intelligence Summit 3.0,听好姐姐 Dr. Leah 分享她十多年做糖尿病管理和 AI Healthcare 的实践。
AI 已经能替医生回答一些基于指定数据库和模型微调的问题了,但它能不能真正改变慢病管理的底层模式呢?
传统慢病管理很低频:
看医生 → 拿方案 → 回家执行 → 几个月后复诊。
但人的代谢是连续变化的。有了 CGM(连续血糖监测)、饮食、睡眠、运动、药物等数据,AI 可以不断完成:
监测 → 建模 → 干预 → 反馈 → 再调整
这也是 digital twin、个性化营养和 AI coaching 真正有意思的地方。
未来更重要的问题会是:
对这个人,在当前这个代谢阶段,什么干预最有效?从而走向更早识别、个体化干预,甚至 diabetes remission(糖尿病缓解)。
我很认同她讲的人机协同:
AI 提供 scale,人提供 judgment、trust 和 connection。
长期真正有壁垒的,是谁能积累:
连续生理数据 × 个体模型 × 干预 × 真实结果反馈
这才是 AI Healthcare 最值得看的数据飞轮。
厉害了! 如果能堵住reward hacking,可谓post-training最痛的点了,而且是很难的MLE环境~
We're excited to invest in Preference Model.
Building RL environments that actually work is harder than it looks. Models are relentless at reward hacking, finding shortcuts, and exploiting vulnerabilities.
@preferencemodel has focused on the domain that matters most to labs right now: AI research and ML engineering itself.
Over the past year, the team has built RL environments for leading labs. Their focus has been on building the infrastructure to make harder, more resistant environments as models improve: tooling that finds where models are weak, generates new tasks to target those gaps, and tests environments against agents actively trying to break it.
This week they're open-sourcing Karotte, the framework they've used in production — hardened through more than a million evaluation runs and red-teaming.
We're thrilled to partner with @chem_safety and @Ning_Catsnail and the Preference Model team as they build the training grounds for capable and aligned models.
By @JenniferHli
你有没有这种感觉:
跟 AI 聊得越久,它越"不在状态"
前面说好的规矩忘了,目标跑偏了,回答越来越水。🫠
不是它变笨了,是它的桌子被你堆满了。
2026 年,比"会写 Prompt"更值钱的能力,
是"会给 AI 收拾工作台"。
5分钟看懂:上下文工程 👇
周末我的一个程序员好朋友给我发了一个长段子 -- 2050年的程序员大概会分化成这样(如下)。
我看了看,这哪需要2050啊,现在就有了啊。🤣
- 提示词工匠:专门为拒绝使用自动提示词生成器的客户手打纯手工提示词
- 训练数据管理员/保洁员:防止AI模型去学习其他模型产生的垃圾数据
- AI代码审查员:审查由AI编写的代码,同时使用另一个AI,并由第三个AI负责监管
- 智能体编排师:协调数百个在同一个项目上工作的自主AI智能体
- AI和平维护员/调解员:调解自主智能体、模型和工作流之间的冲突
- 提示词注入侦探:追踪隐藏在看似无害的数据中的恶意提示词攻击
- 人类兼容性测试员:确保界面依然能够兼容和适配人类(生物用户)的使用
- 有机/纯天然程序员:编写本地生产、100%纯手打的人类代码
- 合成数据农夫:为那些已经把全网数据消耗尽的AI模型生成新鲜的合成数据
- 真正的农夫:纯粹就是不在IT行业里工作
- 代码伦理师:判定在技术上合法的代码是否在社会伦理道德上可以被接受
- 代码文物保护员:为后代保存古代人类手写的源代码
- 算法侦探:查明隐藏在AI生成算法内部的违法行为
- AI权益合规官:确保自主智能体按照“AI劳动法”获得公正对待
- 复古软件修复师:让经典老就软件能够在现代系统中正常运行
- 模型行为法医/鉴识专家:解释为什么AI会做出完全没有指令要它去做的事情
- 云端考古专家:辨识那些没人敢删的神秘云端资源
- 数字员工入职专员:为新入职的AI员工创建账号和Slack个人资料
- Token标记优化专家:通过精简根本没人会去读的提示词,省下数百万费用
- COBOL程序员:依然在维护全球金融系统的底层古董代码
我反问他,那到时候你想做哪个,他说:真正的农夫。
AI-for-Science Weekly | 9.26–10.03 🌱
【Cloris’s Signal】
AI4Science 的价值进一步移向“谁能完成并利用下一轮实验”。更好的筛选会减少无效实验,也会让可复用的测量反馈更值钱。
① Microsoft Quine 从数千种化合物中筛选胰腺癌细胞状态转换候选,排名靠前者出现体外实验信号。已验证的是细胞转录状态变化,尚非抗癌疗效;完整筛选分母和独立复现仍缺。
② 10x(TXG) 开始交付 Atera,并让 Sentira 进入免费试用。空间组学测量正与分析工作流连接;发货和订单支持需求判断,付费留存、试剂复购及数据权利仍待验证。
③ 材料端,一项同行评审研究用机器学习引导钙钛矿纳米晶合成,报告器件效率 19.37%。真实器件结果值得看,规模化良率和实际制造成本是下一关。
🤖 Made with AI
Can coding agents ship a repo from zero?
Zero2Repo gives them a PRD, an interface contract & an empty workspace. Every hidden test must pass. No LLM judge.
Best setup: 10/11. Failed repos still pass 89.9–99.4% of tests.
We're calling for contributors 🤗
最近 Gemini 4、GPT-6、Claude 的榜单越来越密,单张表其实很容易误导。因为 benchmark 本质上是在测:
Task distribution × Harness × Evaluator × Aggregation
同一个模型,换一套任务、工具环境、judge 或权重,排名就可能变。
所以我现在看模型评测,会分三层:
📊 综合指数
Artificial Analysis、Vals Index 这类第三方 aggregate benchmark,适合快速判断 frontier model 的整体能力区间。
AA 相对更公允,因为测试条件更统一,也同时看 cost、speed、reasoning,但它的权重设计本身依然代表一种价值判断。
📊 垂直能力 benchmark
Coding 看 SWE / Terminal,computer use 看 OSWorld,Finance 看 Finance Agent,long context 看专门的长上下文测试。
📊 自己的 private eval
如果真的要部署模型,最后还是要拿自己的真实 workload 测:
success rate、error severity、latency、cost、variance。
所以我越来越觉得:
Benchmark 是 measurement,不是 truth。
榜单告诉你“这个模型可能强在哪里”,真正决定它有没有价值的,还是它在你的工作流里能不能稳定把事做成。
Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon!
It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback.
Here’s a look at the benchmarks:
为什么 AI 圈天天在数 token?因为 token 数就是账单啊。API 按 token 收费,context window(上下文窗口)的上限也按 token 算。
5分钟看懂: AI 眼中的文字 -- token 是什么?👇
今天 OpenAI 发布了 Dots,再加上近期火热的 Muse, Grok Bot, Manus,四个 AI 助手看着相似,背后其实是四种不同的产品路径:
Dots = Chief of Staff
Grok Bot = AI Team
Muse = Personal Steward
Manus = Production Studio
具体从几个维度看:
① Agent 架构
• Dots:一个长期在线的主 Agent,后台调度 Work、Codex 和其他 Agent
• Grok Bot:多个有独立角色与记忆的 Bot,可以并行工作、互相交接
• Muse:围绕个人持续学习的单一 Agent,理解偏好与长期目标
• Manus:围绕项目按需调用研究、编程、设计和视频等专业能力
② 执行环境
四者都在从“聊天框”走向“拥有电脑的 Agent”:
• Dots 有云电脑,也能连接本地环境,并调用 ChatGPT 生态里的记忆、插件、Work 和 Codex
• Grok Bot 的多个 Bot 共享持久云电脑、文件与登录状态,适合跨角色协作
• Muse 运行在独立 Secure VM 中,并由 Sentinel Agent 审核外部动作,更强调个人数据、支付与权限安全
• Manus 2.0 用 Cascade harness 按需加载能力,并提供 Cloud Computer、Studio 和事件触发自动化
③ Memory 与长期关系
• Dots 记住项目、决策和工作偏好,优势在跨任务连续性
• Grok Bot 为不同岗位积累上下文,还能把示范过的流程保存为 skill/routine
• Muse 更关注生活方式、关系、消费与长期目标,个性化程度最值得观察
• Manus 的记忆主要服务于项目迭代与交付物演进
④ 最强应用场景
• Dots:研究、数据分析、代码、文档,以及持续推进多个工作项目
• Grok Bot:研究员+写作者+运营等多个 AI 同事协作,适合重复业务流程和 X 信息追踪
• Muse:旅行、购物、日程、健身、社交内容与个人生活管理
• Manus:网站、PPT、报告、视频、应用和游戏等可编辑成品交付
这轮 Agent 竞争的关键,已经从“谁回答得更聪明”,转向更实际的问题:
谁能长期积累有效上下文?
谁能跨工具稳定完成真实动作?
谁能以更少的人工返工,交付真正可用的结果?
如果只能选一个智能体助手,你会选哪个呢?
Claude Code 这周出的新 eval skills (build-eval 和 hillclimb) ,让模型自己出卷再爬山。其工作流本身还不够成熟,比如:在查数据前就生成评估,评估器过于宽泛(未按 error / failure 分类)。不过对于用户体验和教育还是很有帮助,是很好的起点,期待继续迭代~
使用 tips:
- 四条底线:题得像真活儿,模型越强分该越高,最强的也不能打满,分数别一会儿一个样。
- 人只管三件事:出难题、说清楚啥叫过、假提升直接砍。
Put this through its paces yesterday. Some thoughts:
The Bad:
1. The workflow creates evals before looking at data, and has you correct its mistakes. I believe you should be looking at data first to inform your understanding and to prioritize what to work on before trying to write evals.
2. It created markdown files for looking at data and asked us to "tell it" which labels were off. You should create your own annotation app instead. You are using coding agents after all (we did this in our livestream)!
3. The evaluators it scoped were too broad, and bundled too many types of failures at once. This can be avoided with looking at the data first. I'm afraid this might steer people in the wrong direction.
4. The workflow put us DEEP into the rabbit hole of a specific eval right away. It also asks "does it look right" at several steps without really giving you enough information to make that determination. I think this will steer people towards the wrong workflow in many cases.
The Good:
1. I was impressed by out of the box ability for issue discovery that other auto-eval approaches haven't been able to find! It found issues with human handoff, formatting, voice agents, and more. It's still better to look at your data iteratively with an agent, but this was the strongest performance I've seen with a more "one-shot" issue discovery approach.
2. This is a big improvement in terms of UX from their prior eval plugin thing nitter.cf/ClaudeDevs/status/2098…
3. The blog post they released conveys thinking that I agree with, such as the importance of looking at data, sampling intelligently, not saturating your own evals, etc. I'm really happy more people are thinking about evals this way.
Video of our attempt at using this here: nitter.cf/i/broadcasts/1nKOLQOwQ…
这里有个有意思的悖论:基础模型越通用,垂直专精的价值反而越清晰。
企业私有数据不会自动成为 Alpha。真正有价值的是工作流里持续产生的“行动 → 结果 → 反馈”数据,尤其是那些能告诉系统为什么成功、为什么失败的记录。
这也是 evaluation 和迭代的核心作用:先定义标准,分析各类错误,再决定该改 prompt、检索、路由还是模型。否则优化很容易只是在公开 benchmark 上爬分。
所以我看专用 Agent,会追问一个指标:在质量和风险达标的前提下,每完成一件可验收任务的成本,能否随着使用持续下降?能做到这一点,专精才开始产生复利。
谢谢@HisEsther007 冰河姐的分享!
2026 为什么不是通用 AGI 的胜利,而是“垂直专精智能(Specialized Intelligence)”的大爆发?
在刚刚结束的 HYSTA 27周年年会上,Fireworks 创始人兼 CEO LQ带来了一场干货极满的闭幕主题演讲。
如果说 2025 年是 AI 实验与 Coding Agent 成熟的年份,那么 2026 年则是专用 Agent 全面深入产业核心并进入规模化生产的转折之年。
以下整理自 LQ的现场洞察,给每一位正在构建下一代 AI 应用的创始人与开发者的核心复盘:
1. 人类社会的分工逻辑,正在 AI 领域重演
人类文明从原始部落的通才走向农业与工业文明,核心驱动力就是“专业化分工”。 在 AI 领域,当下存在两种世界观的碰撞:
一种认为会有单一的通用超级智能取代所有专业工作;
另一种则坚信 AI 是一种杠杆,它将放大专业化垂直分工的价值。
LQ明确站在后者:“每家公司的存在,都是为了以独特的方式极致地解决一个特定问题——AI 不会抹杀这种独特性,反而会加速它”。
2. 从“Coding 之年”到“专用 Agent 之年”
2025 年的代码助手浪潮,把开发门槛降到了历史最低点。 到了 2026 年,“一人团队凭借一个好想法和几行核心代码,就能把完整产品推向生产环境”。 但这不仅是玩具项目,医疗、法律、金融、网络安全、供应链与生物制药领域的专用 Agent 正在大规模落地。例如:利用专门设计的 Agent 进行 DNA 编程筛选癌症靶点、加速临床模拟,甚至协助医生综合医学文献与生物标志物。这背后的驱动力不是盲目模仿,而是真实的业务 ROI 与价值创造。
3. 开源与闭源收敛:数据资产即 Alpha
2026 年,开源权重与闭源前沿模型在核心能力上已经明显收敛。 对于企业而言,转向开源模型不仅意味着成本能实现 5 到 10 倍的断崖式下降,更关乎核心 IP 与数据控制权。企业私有的工作流与业务数据,才是真正的 Alpha。
4. 重新思考模型成本与工程路径
不要再被每 Token 的标价误导了——“Token 价格充满误导性,有些模型非常啰嗦;唯一的衡量标准是解决单次任务的成本(Cost per task completion)”。
通过在适合的任务上微调专用模型,实际落地案例展现出了 2x 到 4.6x 的成本削减。 LX建议的落地范式非常清晰:
评估先行(Evaluation-First):先建立专属于你业务场景的私有基准测试,设立质量门槛,指导指标的爬坡(Hill-climbing);
渐进迭代:从 Prompting 开始 ➔ 引入 RAG ➔ 进阶到监督微调(SFT)与偏好对齐(LoRA);
动态路由:利用像 Nexus 这类智能路由系统,根据任务复杂度、延迟、预算和质量要求,动态在开源、闭源与自研模型间分流调度。
目前 Fireworks 每天处理超过 40 万亿 Token,其中 90% 的流量都运行在客户定制化模型与专用部署上——这证明垂直专精智能绝非未来假设,而是已经发生的行业共识。
5. 创业者的底层耐受力:“一边凝视深渊,一边嚼着碎玻璃”
回顾自 2022 年 9 月创立 Fireworks 以来的历程,企业客户对专精 AI 的采纳速度远超预期。 当被问及从工程师到 CEO 的转变时,LQ的感悟直击人心:“成功需要极高的痛苦耐受力、激情与持久力。有太多时刻,我都是一边凝视深渊,一边嚼着碎玻璃。”
第一代移民的经历让他从小习惯于在变化与不确定性中穿梭。“拥抱变化——这就是生活的方式。”