@Compute_Kingi
iAccount based inEast Asia!
About this account
- Account based in
- East Asia
- Connected via
- Southeast Asia App Store
! X says this location may be affected by a proxy or VPN.
Account-level information from X, not a live location or the device used for a specific post.
Husband & Father | Lifelong Learner | Creator & Innovator Semi · AI · HPC · GPU Computing Guru https://nitter.cf/t.co/CwuyluWbyy
Earth
Joined September 2024
- Tweets10.8K
- Following713
- Followers28.1K
- Likes32K
英伟达的卡买不到之后,中国大模型靠什么继续跑?
by 张贝贝@虎嗅
链接:
mp.weixin.qq.com/s/StXDat4bm…
下图制作:虎嗅妙投
美国时间9月24日,高通宣布与苹果续签全球专利许可协议,新协议将于2027年4月1日生效。
Qualcomm 高通 $QCOM
Start: nitter.cf/Compute_King/status/18…
Part 1 —— nitter.cf/Compute_King/status/18…
Part 2 —— nitter.cf/Compute_King/status/18…
Part 3 —— nitter.cf/Compute_King/status/18…
Part 4 —— nitter.cf/Compute_King/status/18…
高通(Qualcomm):从比萨店楼上的小公司到无线通信霸主
Part 4 of 4
接着昨天,今天聊聊高通的的财务,业务机会和挑战。
第六,财务
下图是高通过去八个季度的Non-GAAP财务数据,
1,总体收入与净收入波动:
* 收入(Revenue)同比快速增长。Q1FY25创下历史最高收入116.69亿美元。
* 净利润(Net Income)总体呈增长态势,Q1FY25达到高点38.3亿美元,显示近期盈利能力有所增强。
2,每股收益(EPS)增长:每股收益从Q3FY23的1.87美元逐步增长到Q1FY25的3.33美元,表明公司在剔除股票回购之外的盈利能力表现稳健。
3,芯片部门(QCT)表现:芯片部门收入(QCT Revenue)占总收入的主要部分,整体呈上升趋势,从Q4FY23的86.78亿美元增长到Q1FY25的103.08亿美元。QCT的税前毛利率(Pre-tax Margin)在27%-31%之间波动,显示出稳定的盈利能力。
4,细分芯片市场表现:
* 手机:手机业务是芯片部门的核心支柱,收入从Q3FY23的53亿美元增长到Q1FY25的75.74亿美元。
* 汽车:汽车业务收入过去两年翻了一倍多,增长至Q1FY25的9.61亿美元,显示出很强增长潜力。
* 物联网:物联网业务表现相对平稳,Q1FY25达到15.49亿美元。
5,专利授权(QTL)稳定性:专利授权收入(QTL Revenue)保持稳定,税前毛利率长期维持在66%-75%之间,展现出极高的高利润率和稳定的现金流贡献。
第七,高通的核心竞争力分析
手机芯片:
高通在高端手机芯片领域具有明显竞争优势,包括领先的5G技术和相关IP,强大的SoC(系统级芯片)设计能力以及与全球主要手机厂商(包括三星,小米等)的深度合作关系。其Snapdragon系列芯片广泛应用于高端智能手机市场。
如我们昨天聊的,在营收和高端市场,高通仍然占据绝对优势,全球市场手机芯片的市场份额,按营收占比约40%;联发科虽然出货量大,但营收占比仅约16%。
物联网:
高通在物联网领域凭借其低功耗、高性能芯片和广泛连接技术(如Wi-Fi、蓝牙等),为智能家居、工业物联网等提供解决方案。虽然增长速度较慢,但其技术生态具备长期竞争力。
汽车芯片:
高通汽车芯片业务增长迅速,收入在过去两年翻了一倍多,尤其是在自动驾驶计算平台(Snapdragon Ride)和车载信息娱乐系统领域。其与车企合作深入,并受益于汽车行业向智能化、电动化转型。
其他业务潜力
高通正在扩展PC市场,通过推出基于ARM架构的PC芯片与英特尔、AMD竞争。随着市场对高能效PC需求增加,高通有机会凭借低功耗和集成5G连接功能占据一席之地。然而,该领域面临激烈竞争,需要时间积累市场份额。
专利授权(QTL)的重要性
高通的专利授权业务是其现金流的重要来源。凭借在通信技术(尤其是5G)的核心专利,高通能够从全球设备制造商中获得稳定授权收入。尽管专利授权业务面临监管审查和法律挑战,但其高毛利率使其对公司整体盈利贡献巨大。
第八,未来的挑战
1,持续技术创新和迭代:
随着AI,6G等新技术的发展,高通需保持高比例研发投入以确保技术领先地位,同时应对新兴技术带来的颠覆性变化。
2,市场需求波动:
手机市场趋于饱和可能限制增长,高通需要进一步拓展汽车,物联网,PC等市场以拓展市场空间。
3,竞争加剧:
* 在移动芯片领域,高通面临来自联发科,华为等竞争者的压力;
* 手机厂商自研芯片趋势:苹果自研芯片,谷歌已经推出了自研的Tensor芯片。未来,更多厂商可能效仿,减少对高通的依赖。
* 在汽车领域,也需应对NVIDIA等强劲对手以及车企自研。比亚迪在去年底推出BYD9000芯片,采用4nm工艺+Armv9,甚至还集成了5G基带芯片。
* 在PC市场,虽然“骁龙X Elite”进入了PC市场,但X86的英特尔,AMD仍然是主流。在ARM的生态体系,苹果M系列芯片依然是其最大对手,高通要想真正挑战苹果,还有很长的路要走。
4,地缘政治与监管风险:
* 中国市场对高通极为重要,根据最新财务数据,高通来自中国(包括香港)的收入占比超过45%。华为,小米,OPPO和vivo等安卓厂商都是高通的大客户。
* 如果中美地缘竞争加剧,这些厂商可能会倾向于使用国产芯片。
* 全球监管机构对专利收费模式的审查可能影响高通的国际业务布局和盈利模式
第九,总结。
从Hedy Lamarr的故事开始,聊了好多天了。简单总结一下:高通的核心业务,特别是在无线通信和芯片技术领域,仍然非常强劲,尤其是在5G技术的应用与推进方面。这么多年,它仍在通过不断的技术创新强化其在移动设备市场的主导地位,保持了竞争力。这点从公司持续增长的业绩也能体现。
不过,随着市场的不断变化,尤其是面对其他芯片厂商的普遍成熟,高通也确实需要寻求更广泛的多元化布局,尤其是加强在汽车,物联网,AI,PC芯片等领域的拓展。
纯粹个人看法:目前高通在美股科技股的估值相对偏低,长期来看有显著的估值提升的机会。
那么问题来了,除了刚才提到的6G,汽车,物联网,AI,PC市场之外,您认为高通在哪些新兴领域的布局可能最为关键?
$QCOM
#Qualcomm
苏姿丰(Lisa Su),绝对是一个了不起的故事!
AMD的逆袭之路
书接上回。这一节和大家聊AMD建立的核心产品线和竞争力。
大家看我关于AMD的Part 1和2,知道他的主营业务从CPU起家,收购ATI获得完整的GPU产品线,后来演变成了AI加速器的基础,AMD的定制业务包括为Sony,微软,Tesla定制的游戏和车载芯片;2022年,AMD还先后收购了赛灵思(Xilinx)和Pensando,进入FPGA和DPU赛道。至此,在数据中的芯片领域,AMD除了没有自有交换和互联的资产外(但是它在尝试对外投资),在其他领域积累算是相当完整。
AMD自己把业务分成了四个板块:数据中心(包括服务器 CPU、FPGA、收购 Pensando带来的云业务以及数据中心GPU产品),消费者业务(台式及笔记本电脑),游戏业务(台式及笔记本电脑 GPU产品和定制化业务,主要收入来源于为微软 Xbox 以及索尼 PS5 游戏机提供主芯片),嵌入式业务(包括嵌入式 CPU、GPU、APU、FPGA 以及传统嵌入式产品)。
从产品的角度来说,大致可以分成下面几类:
(1),处理器(CPU)
a. 桌面处理器
AMD以其Ryzen系列处理器赢得了广泛的市场认可。这些处理器的主要特点是:
* 高核心/线程数:AMD Ryzen系列率先引入多核、多线程架构,为用户提供强大的并行处理能力。
* 先进制程:利用台积电(TSMC)的先进制程技术(如7nm和5nm),使Ryzen处理器在性能和能效上具有优势。
* 主流应用:Ryzen系列覆盖了从入门级(Ryzen 3)到旗舰级(Ryzen 9)的多个细分市场,满足从普通用户到高性能玩家、创作者的需求。
b. 服务器处理器
EPYC系列:专为数据中心、云计算和高性能计算(HPC)设计。EPYC处理器以高核心数、高内存带宽和卓越的性价比著称,在云服务提供商和数据中心市场快速崛起,与英特尔至强系列形成直接竞争。
c. 笔记本处理器
Ryzen Mobile:针对超薄本和高性能笔记本电脑市场,支持高能效运行,结合集成显卡技术提供卓越的移动体验。
(2)图形处理器(GPU)
AMD通过其Radeon系列GPU在独立显卡和集成显卡市场占据重要地位:
a. 桌面显卡:Radeon RX系列支持游戏和内容创作,提供实时光线追踪、优化能耗和先进显示技术。
b. 集成显卡:APU(Accelerated Processing Units)将高性能CPU和Radeon显卡结合,为紧凑型设备提供优质图形体验。
c. 数据中心GPU:Instinct加速器卡用于AI和HPC工作负载,凭借高能效和出色并行计算能力,与英伟达(NVIDIA)的CUDA平台竞争。
(3)FPGA
AMD的FPGA产品线源自Xilinx的收购,成为其产品组合的重要一部分。这一领域主要包括可编程逻辑设备(FPGA),自适应计算加速卡(ACAP)和硬核SoC产品线,为AMD提供了在嵌入式系统、数据中心、AI 加速以及通信领域的多元化竞争力。
(4)DPU和可编程网卡(NIC)
产品线来自收购的Pensando。AMD利用可编程DPU为超大规模计算提供动力,为下一代AI网络提供支持。AMD推出了用于前端(向AI集群提供数据和信息)的AMD Pensando Salina DPU和用于(管理加速器和集群之间的数据传输)的AMD Pensando Pollara 400。
(5)半定制芯片
AMD为游戏主机或者车载开发的定制芯片:比如说索尼PlayStation和微软Xbox的核心芯片都基于AMD的CPU和GPU技术,这一合作关系确保AMD在高性能游戏机领域的长期收入来源。
(6)嵌入式解决方案
AMD的嵌入式处理器广泛用于工业设备、医疗设备、汽车电子和物联网设备,提供高度定制化的解决方案。
今天我们只聊一些感兴趣的方面,所以会更多聊数据中心,定制业务,AI ASIC相关的市场,类似于像PC端的消费者业务我就带过,不多聊了。
当然,诚如Lisa所说,很明确,AMD 2024年的优先事项就是通过提高Instinct GPU产能和利用Epyc处理器扩大市场份额来加速数据中心业务增长
个人认为,服务器CPU市场渗透率提升仍然是AMD数据中心业务的主要增长动力:IDC研究表明,2022年全球服务器市场规模达1230.2亿美元,其中x86服务器市场规模占比达90%。预计到 2027年全球服务器市场规模可达1860亿美元,其中X86架构的服务器占比86.5%。而得益于 EPYC服务器处理器的性能和成本结构,从国内大的云服务提供上来看,AMD产品已经是标配了,阿里已经批量采用,腾讯基础架构部门新的一代服务器,尤其是GPU服务器,甚至只有AMD的版本,稍微小一点的UCloud,更是全线AMD产品。在新的大型订单里面,AMD的一些高核心数型号甚至找不到Intel的竞争性产品,Intel方面在不管是核心数和产品性能都有差距。所以,Intel实在太弱了,个人预计AMD在2024年底的服务器芯片实际市占率就可以超过30%左右。2005年应该会显著更高。
在最新的“Advancing AI 2024”活动上,AMD发布了全新的Instinct MI325X加速器。这款产品可以说是行业的标杆,配备了256GB的HBM3E内存,支持高达6.0TB/s的带宽。和英伟达的H200相比,它的内存容量高了1.8倍,带宽也增加了1.3倍。理论上,MI325X在FP16和FP8计算性能上比H200提升了1.3倍。凭借这些优势,MI325X在FP16精度下对Mistral 7B模型的推理性能提升了1.3倍,FP8精度下对Llama 3.1 70B模型的推理性能提升了1.2倍,而在FP16精度下对Mixtral 8x7B模型的推理性能更是提升了1.4倍。这些性能改进无疑让它成为高端AI任务的理想选择。
AMD预计在2025年第一季度进入市场,届时会被广泛应用于Dell、Eviden、Gigabyte、HPE和Lenovo等合作伙伴的系统中。
除此之外,AMD也带来了下一代Instinct MI350系列加速器的年度路线图。基于最新的AMD CDNA 4架构,新一代MI350系列加速器在推理性能上相比CDNA 3架构提升了35倍。具体来说,当前MI300X可以提供1.3 petaflops的FP16性能和2.61 petaflops的FP8性能,而即将发布的MI355X会将这些数字提升到2.3和4.6 petaflops,同比提升77%。不仅如此,MI355X还支持新引入的FP4和FP6计算格式,使得其算力在FP4精度下可以达到惊人的9.2 petaflops。
不过,MI355X规划到下半年上市,等它出来之后,NV已经过度到GB300了,目前规划的这个规格和GB300比毫无优势。
另外,从业务的角度讲,今年AMD GPGPU业务虽然显著增长,但是隐忧不少。诚然,MI300X于去年底发布,规格参数相当不错。收益于较大的HBM容量,MI300X在推理方面有非常强的竞争力。Dell、HPE、Lenovo是其OEM伙伴,而ODM合作伙伴主要是Gigabyte,SMCI和Quanta。客户方面,主要是MSFT,Google,Oracle,Meta,还有一系列规模较小的AI公司。这些大的云服务提供商的策略也很简单,主要供应商NVDA,次要供应商备选,再加上自研AI ASIC,比例会浮动,但三者得都有。
目前MSFT使用MI300X支持OpenAI的ChatGPT,同时支持Copilot基于GPT4提供服务,Meta部署部分MI300X以支持Llama405B模型,Oracle也采用数万片MI300X,打造AI超级集群。总体来说,AMD还是收获了不少大单,得到了用户的认可。而包括MSFT和Meta在内的客户也花了大量的人力帮助反馈和解决MI300X的软件问题。
苏姿丰在Q2的电话会中就介绍过:MSFT对MI300芯片的使用量增加,以作为GPT-4 Turbo的算力支撑,并支撑SMSFT的word,teams等多个Copilot服务。Hugging Face则是首批采用新的MSFT Azure实例的客户之一,使企业和AI客户能通过一次点击,便在MI300 GPU上部署数十万个模型。就在前两个星期,ROCm 6.3发布了,也是AMD开源平台的一个重要里程碑,引入了先进的工具和优化,能显著提升在MI300X这样的加速器上的AI和机器学习工作负载的性能,据说通过软件优化,MI300X推理性能自硬件发布以来已经提升了2-3倍。
但目前来看,MI300X的销售额总体在分析师估计的附近,没有爆表。当然,肯定是表现不如去年底的一些乐观预期的。这里面有一些产品的问题,包括发热,最主要的还是GB200的竞争力爆棚,大的云服务提供商都all in。而且NV的产品更新周期加快,造成AMD的优势不再明显。所以,整体看起来,AMD的MI300X显然是很挑战的。确实是应了那句话,H100都跌下来到MI300X这个价了,你MI300X还怎么卖呀?
另外,从第三方的增量信息看来也是:电力现在是GPU大规模部署的最大瓶颈。微软和亚马逊都在将数据中心建到核电站旁边。太阳能和风能这样的可再生能源都不适合数据中心。GPU数据中心需要的是更多的基础负荷电力,传统电力比如煤炭和天然气发电。其他加速卡,即使通过各种方式实现了CUDA兼容或者适配,但依然有巨大性能损失,请注意这里的损失比例可能是30%、60%、80%。还没有看到客户大面积使用AMD MI300X,确实有合作,但一旦客户到大规模部署,还是会选择英伟达。
从AI发展节奏来看,有一点是确定的,就是2025要不可逆转的要走向推理了。从市场的角度,推理的需求也将比训练更大。而在我看来,GB300毫无疑问是可见的明年市场上,推理性价比最高的平台。MI325X和MI355X有非常艰难的路要走。
(全文完,不详尽的地方大家一起交流。谢谢)
国务院任免国家工作人员(2026年9月20日)
据人力资源和社会保障部官网9月20日(周日)消息,国务院任命李成钢为中华人民共和国国际贸易谈判代表(正部长级),凌激兼任中华人民共和国国际贸易谈判副代表。
公开资料显示,李成钢现年59岁,安徽太湖人,毕业于北京大学法律系,后获德国汉堡大学法律经济学硕士学位,系中美经贸谈判中方核心成员。
周六,据路透社援引消息人士报道,中美正讨论降低或取消中国对美国液化天然气加征的15%关税,并考虑将相关安排纳入一揽子能源和农业协议。双方还可能分别削减对彼此约300亿美元(约382亿新元)商品加征的关税。相关协议最快可能在习主席周四访美期间公布。
周日,美国财政部长贝森特表示,美中官员当天在纽约举行的会谈取得成功,双方重点讨论了贸易问题和人工智能。
据法新社、路透社报道,贝森特在周日与中国国务院副总理何立峰会晤后对记者表示:“我们刚刚与中方就贸易和人工智能进行了一次非常成功的接触。”贝嫂表示,双方同意再次举行会谈,但未透露更多细节。
市场相信,之前的接触将为美国总统特朗普与习主席星期四(9月24日)举行的峰会奠定基础。
今晨,中方代表团抵达马来西亚。可以看到视频中,何立峰副总理与商务部副部长,国际贸易谈判代表李成钢一同现身谈判现场。。。
贝嫂的噩梦又要重演了。。。
This morning, the Chinese delegation arrived in Malaysia. In the video footage, Vice Premier He Lifeng and Vice Minister of Commerce, as well as China's International Trade Representative Li Chenggang, can be seen entering the negotiation venue together...
Beseent's nightmare is about to replay once again...
AI与消费电子补库共振:2026年二季度全球前十大晶圆代工产值创历史新高
前十大代工厂合计营收达534.9亿美元,环比增长11.5%;据传台积电把2nm晶圆代工价定在~3万美元以上,比一片3nm晶圆的~2万美元贵了~50%,下个季度台积占有率还得涨。中芯国际增速达20%,与三星差距进一步收窄。
TrendForce最新研究数据,2026年第二季度全球前十大晶圆代工厂合计营收约为534.9亿美元,环比增长11.5%,再创历史新高。
增长动力不仅来自AI HPC主芯片对先进制程的持续需求,也来自PMIC,Power Discrete,网络及接口等AI基础设施周边芯片的订单扩张。同时,电视,PC及笔记本供应链提前备货效应延续,使部分成熟制程产能重新趋于紧张。
从产业结构来看,本轮晶圆代工市场并非只有3nm,4nm,5nm等先进制程受益。AI服务器的电源管理,功率器件,网络连接和存储配套芯片,同样正在形成规模可观的增量需求;而消费电子的提前备货,则进一步改善了成熟制程的订单能见度与产能利用率。
台积电继续扩大领先优势
台积电第二季度营收接近402亿美元,环比增长12.1%,以72.5%的市占率继续稳居全球第一。AI服务器GPU和XPU需求推动其5nm,4nm及3nm先进制程产能维持高负载运行;与此同时,iPhone新机进入备货周期,2nm制程开始贡献营收,带动晶圆出货量与平均销售单价同步上升。
台积电官方财报显示,公司第二季度美元营收为402亿美元,按公司财务口径环比增长12.0%;2nm制程已经贡献晶圆销售金额的3%,3nm和5nm制程分别占30%和33%,7nm及更先进制程合计占晶圆销售金额的77%。台积电官方财报
三星排名第二,中芯国际快速追近
三星晶圆代工第二季度营收约为32.6亿美元,环比增长1.8%,排名全球第二,市占率为5.9%。其增长主要受益于HBM Base Die等先进制程新订单逐步放量,以及5nm,4nm及以下先进制程代工价格上调。
中芯国际第二季度营收环比大幅增长20%,突破30亿美元,排名第三,市占率小幅升至5.4%。其增长来源包括PC及笔记本供应链提前备货、AI周边芯片和服务器网络芯片订单增加,以及存储器供给偏紧带动NAND Flash,NOR Flash代工需求及价格上行。
按TrendForce披露口径,三星与中芯国际的营收差距已收窄至不足2.6亿美元,市占率差距仅为0.5个百分点。中芯国际成为本季度全球主要晶圆代工厂中增速最突出的企业。
第三季度仍有进一步增长空间
TrendForce判断,第三季度消费性IC客户仍维持一定投片强度。一方面,客户担心成熟制程产能继续被挤压,并预期下半年晶圆价格上涨;另一方面,旗舰智能手机进入备货周期,AI HPC平台也将向新一代产品切换并逐步放量。
这意味着晶圆代工行业正在形成一条更完整的AI需求传导链:先进制程承接GPU,XPU和服务器CPU,成熟制程承接PMIC,Power Discrete,网络,接口及显示驱动芯片,而存储器代工则受益于供给偏紧与价格上行。
大家看到这里,笔者也要提醒一下:TrendForce公布的“前十大晶圆代工厂合计营收”和“单厂市占率”并非完全相同的统计分母。按公开数字计算,402亿美元除以前十大合计534.9亿美元约为75.2%,并不等于72.5%;这表明534.9亿美元这个数字是前十大厂商营收加总,而计算72.5%比例时应该采用了更广义的全球晶圆代工市场口径。
Top 10 fabs globally according to TrendForce. Looks like SMIC is really catching up to Samsung now, which indicates its making more of that AI chip $.
Overall, it's still below the 5.6% share that it had a couple of yrs ago, which shows just how much TSMC has expanded its lead over everyone else in the foundry business.
GLM开始参与构建新的GLM
清华大学计算机系教授,智谱创始人唐杰老师刚刚分享了一个团队内部观察到的RSI案例。
最近大佬们聊的所谓RSI指的是Recursive Self-Improvement,中文通常译为“递归式自我改进”。
简单来说,它的核心逻辑是:让AI参与构建更强大的下一代AI。一个成熟的AI系统帮助开发下一代模型,提高研发效率,一旦这个循环运转起来,AI的进步速度可能远超现在的人工迭代方案。
但是呀,这里一般的有个但是,并非所有“AI改进AI”都能叫RSI。判断的核心关键在于:下一代系统是否比上一代更擅长“制造/优化”自己的后继者。
一个系统可能每次跑分都高一点,但却越来越慢,越来越贵,更依赖人工输入,这最多只能算是版本更新。而真正的RSI,是系统能用更少的资源,造出更好的下一代,即“系统越来越擅长变得更好”。
国内一篇由上海交大,清华和字节等机构合作的论文预印本《The Last AI Built by Humans》,将RSI的自主性划分为L1到L5五个层级:
L1 执行人类给出的改进方案;
L2 自主寻找改进策略;
L3 决定需要获取哪些经验;
L4 将部署环境中的反馈转化为持续保留的改动;
L5 改进机制本身也成为改进对象;人类制造的不再只是一个模型,而是一套能继续持续制造和优化模型的系统。
在笔者看来,按照这套标准,目前绝大多数宣称的“AI进化”都远未达到真正的RSI要求。
唐老师分享的这个案例:GLM-5.3驱动的Infra Agents在超过10万张国产芯片集群上,从零参与搭建并优化生产级推理系统,不到两周端到端吞吐提升至基线的3.2倍。
这里AI并没有直接修改自己的模型权重,而是改进了自己运行所依赖的底层基础设施(推理系统的搭建与优化)。
所以唐老师说这是“RSI早期案例”:它展示了AI开始介入自身运行环境的优化,这正是递归循环的起点。
Two weeks.
That's how long it took to go from GLM-5.3-Flash's first run on domestic accelerators to serving all of its production traffic, with 3.2× end-to-end throughput along the way.
What I keep thinking about is who did much of the work: an Infra Agent powered by GLM-5.3.
A model helping optimize the system that serves it.
The conditions were hard. Limited memory and interconnect bandwidth. 1M-token context. Multimodal requests. An immature software stack where kernels were missing and documentation was often guesswork. Every optimization was a trade: compute for memory (ReplaySSM), communication for memory (intra-node tensor parallelism), precision for capacity (mixed INT8/FP8/BF16 caching), and disaggregation for scheduling freedom (Encode–Prefill–Decode).
But the most important lesson wasn't about any single optimization.
When the agent got stuck, it was rarely because it couldn't write the code. It was because it didn't know *why* things got worse.
"Throughput down 20%" tells you something broke. It doesn't tell you which layer, which hypothesis, or what to test next. In RL terms, it's a sparse reward with a credit assignment problem. And an end-to-end benchmark that takes hours makes exploration painfully slow.
Senior engineers solve this with an implicit process reward in their heads. They know when to check the timeline, when to run a microbenchmark, and which layer's output to compare.
So we made that explicit. We call it dense feedback: layered verification interfaces the agent can call directly.
Correctness feedback: did it compute right?
System behavior feedback: where did the time go?
Performance feedback: which option wins, under which conditions?
Each signal has to be local, cheap, and objectively verifiable.
Three things the agent found:
First, precision drift in KDA's context-parallel path that grew with sequence length. The cause was TF32 rounding error compounding through chained state-matrix merges. The fix is now merged upstream in Flash Linear Attention (PR #1180).
Second, KV transfer never overlapped with DeepEP dispatch. The agent followed the call chain across the Python/C++ boundary and found that the intranode path never released the GIL. After the fix, transfer overhead fell from over 30% to under 1%.
Third, a decode kernel recomputing the same normalization four times because of how it was chunked. The agent restructured it and got a 1.71× speedup. The idea came from "optimization skeletons" it had distilled by reading existing kernels across SGLang, FLA, and DeepGEMM.
To be clear about the boundaries: humans still defined the goals, built the feedback environment, and reviewed every high-risk change.
But the engineer's role is changing, from the person who solves the problem to the person who designs the feedback.
There's a deeper implication too. A layered, verifiable feedback environment built on real infrastructure tasks is exactly what training the next generation of models needs most. Every task the agent completes can become training ground for its successor.
We are still far from recursive self-improvement.
But the smallest loop now exists.
The model optimizes the system. The system serves the model.
DDR4别急着卖废铁:大厂正在给它开一扇CXL侧门
笔者注:旧的DDR4内存能不能继续干活?新服务器能不能少买几台?资本开支能不能算得更漂亮?Google和Meta最近给出的答案,都是“可以试试”。所以,先别把退役服务器里的DDR4当废铁。
据近期报道,Google正在回收退役服务器里还能用的DDR4内存条,通过CXL转接卡接入新一代AI服务器。这个动作很Google:资本开支再大,也不跟钱过不去。内存涨成这样,能利旧的,绝不轻易买新。
Meta在几个月前就把技术路径摊开了。Tom's Hardware介绍过Meta自研的CXL内存扩展芯片Vistara。Meta团队论文里的MemServer方案,把768GB本地DDR5-6400和256GB经CXL连接的DDR4-2400拼在一起,凑成1TB内存系统。重点不是“1TB”这个数字,而是:原本根本插不了DDR4的DDR5服务器,现在能把老内存吃进来。
但这里必须先说清楚一件事:CXL不是把DDR4的电气接口变成DDR5。
它更像在DDR5服务器旁边开了一扇侧门。DDR4内存条装在CXL扩展卡上,由板载控制器管理,主机通过CXL访问这部分内存。配置完成后,Linux可以把CXL Type-3设备提供的容量纳入系统内存。
那问题来了:DDR4-2400比DDR5-6400慢不少,加进来真有用?
关键要看业务到底卡在哪。如果业务是带宽先撞墙,那加慢速的DDR4内存意义不大;但如果业务是容量先耗尽,处理器利用率还不高,服务器却已经装不下更多任务,那扩容的价值就很高。很大程度上说,这种扩容能推迟整机采购、减少业务拆分、降低集群成本。
Meta和研究团队提出的TPP透明页面放置机制,就是干这个的。它会识别页面冷热,把低频访问的冷页面迁到容量层,把性能敏感的热页面留在本地内存。打个比方:热数据住市中心,冷数据搬去郊区,应用不用自己指定每个页面住哪儿,操作系统层完成调度。
这也解释了为什么“慢速DDR4内存”仍可能改善业务表现。容量够了,系统可能减少换页、容纳更多缓存,或者让单台服务器承载更大的数据分片。收益来自整个业务执行过程的变化,不能只拿两种内存的峰值带宽去判断。
Meta的生产数据给了个具体例子:在机器学习参数服务器负载中,论文报告所需服务器数量减少约20%~25%,吞吐提升约4%~12%;另一项分布式缓存业务的平均查询处理时间降低29%。注意,这些结果对应特定负载和软硬件配置,不意味着所有AI服务器加装CXL内存后都能复制。
笔者今天介绍的AIC-CXL-D44扩展卡,就是冲着这类容量需求来的。它采用AIC插卡形态,双控制器,四个DDR4 RDIMM插槽,单卡容量规划最高256GB。客户可以把通过兼容性与可靠性验证的存量DDR4装进去,给具备CXL支持的DDR5服务器增加内存容量,同时保留原有本地DDR5配置。
对潜在客户来说,吸引力很具体:已有DDR4不用随旧服务器一起退役,新服务器也多了一种扩容选择。比如一台配768GB本地DDR5的服务器,在平台支持、安装空间和软件配置都满足的情况下,加一张配满256GB的扩展卡,总容量能到1024GB。每GB成本,会显著低于满配DDR5。
但别误会,它扩展的是CPU主机侧内存,不是GPU侧HBM的替代品。它的定位围绕主机内存容量和业务承载能力,不是拿来替代高带宽显存的。
从使用角度看,这种扩展最适合优先验证的是:内存占用高、存在较多低频访问数据,同时处理器或其他资源还有余量的业务。参数服务、缓存、数据分析和开发虚拟机,都可以作为筛选方向。
经济账也得算清楚。Medium在报道Meta案例时指出,对Meta而言,重要优势是它拥有大量可回收DDR4,不能把这种优势简单等同于市场上的DDR4采购价格低廉。换句话说,如果你手里已经有批量DDR4资产,又确实缺内存容量,这生意很香;如果你得去市场高价买DDR4,那可能就不香了。
这也是AIC-CXL-D44这张扩展卡的定位:最值得优先服务的客户,是手里有批量DDR4资产、又确有扩容需求的企业。
当然,规模部署还要补齐工程条件。Linux官方文档明确说明,CXL配置涉及平台硬件、BIOS、操作系统和用户策略之间的配合。有PCIe插槽,并不自动意味着可以使用CXL扩展内存。
笔者的判断是:CXL不会让DDR4复活成主角,但会让它体面地退居二线。AI基础设施下一轮竞争,不只是堆GPU,也是把内存层级、旧资产和资本开支算明白。
DDR4没死,它只是换了个工位。不管对大厂还是小厂来说,这比任何技术名词都重要:能省下来的钱,才是真利润。
手机和PC真的扛不住了,DRAM和NAND涨价要放缓?
过去一年多,存储市场像一辆被AI需求踩满油门的重卡:DDR4涨,DDR5涨,HBM涨,NAND涨,SSD涨,连过去没人太在意的eMMC,UFS,也被这轮供应链重定价带着往上走。
市场终于出现了一个重要的信号:涨价还没结束,但最疯狂的阶段,可能已经过去了。
TrendForce最新发布的调查显示:2026 年第三季度,DRAM供应依然紧张,NAND需求也仍然被AI推理和大规模数据中心部署拉着走。但价格涨幅开始明显放缓:传统 DRAM合约价预计环比上涨13%~18%,NAND Flash合约价预计上涨10%~15%。
供应还是很紧,但是手机,PC和消费电子这些传统终端,已经扛不住了。
今天的存储市场,变成了一个被AI重新切分的市场。服务器,AI推理,企业级SSD,RDIMM和高性能NAND,这些方向仍然有强需求,也有足够强的客户支付能力。
但另一边,PC,手机,消费级SSD,电视,机顶盒,传统消费电子,已经明显进入价格敏感区间。比如最近的苹果,再买下去,内存的成本压力就要逼着终端涨价。
强如苹果,终端涨价,消费者也未必会买单。
所以,上游还缺货,下游已经开始慢慢地缺购买力。
PC市场也是最典型的例子。
过去几个季度,PC OEM一直在补库存,因为大家都知道内存会涨,不补就可能拿不到货。但随着高成本组件逐步进入笔记本电脑库存,整机零售价格上涨几乎不可避免。
问题是,目前的PC市场并没有强到可以消化涨价。商用笔记本还可以撑一部分需求,但消费端很疲软。AI PC的故事还在讲,但据笔者所知,用户到底愿不愿意为“本地AI能力”额外多付钱,市场并没有真正给出答案。
所以PC DRAM的矛盾很清楚:供应商仍然在把产能往服务器和AI应用挪动,PC端供应相应减少;而PC厂商又不敢无限接受涨价,因为再往上加,出货量就会受伤。
这是一个单纯的成本传导能力的问题。
手机市场也一样。
LPDRAM价格持续高企,智能手机厂商第三季度大概率会继续提高零售价格,试图把成本往消费者端转嫁。但手机不是AI服务器,消费者不会因为LPDDR涨价就理所当然多掏钱。
尤其是中端和入门机市场,价格带非常敏感。旗舰机可以通过影像、AI功能、屏幕、SoC升级来讲故事,但中低端手机没有溢价空间。
大家看到各手机品牌现在的动作越来越保守:生产计划更谨慎,采购节奏更谨慎,库存也不敢堆。
这反过来会压低LPDRAM的需求。
但诡异的是,LPDDR5的价格并没有因此松动,因为供应商把LPDDR5的产能转去了AI、服务器和高利润产品,移动端拿到的产能并不宽松。
这就是今天存储市场最真实的状态:需求弱的地方,价格也未必跌;需求强的地方,价格更不可能跌。
服务器DRAM则是完全不同的世界。
随着CPU供应逐步改善,服务器出货到2027年仍然有望保持强劲。RDIMM消耗会继续增加,服务器内存库存也会在2026年下半年继续被拉高。
服务器DRAM第三季度仍然供不应求,价格也涨不少,但涨幅也在慢慢放缓。原因并不是需求弱,而是不少采购被长期供应协议(LTA)锁住了。这大概也算是AI时代供应链的新规则:真正有战略价值的客户,不是在涨价时去抢货,而是砸钱把供应锁住。
当然,LTA合同的达成率多高还是靠原厂的几家。
图形DRAM的情况则有点反直觉。
NVIDIA RTX PRO 6000 Blackwell并没有像市场早前预期那样,立刻带来GDDR7需求爆发。笔记本电脑出货疲软,也压低了GDDR6和GDDR7的需求。
但GDDR价格仍然跟着DRAM大盘往上走,在笔者看起来,主要的原因还是产能。供应商会根据利润和客户优先级灵活调整产能,把资源挪到更赚钱、更确定的产品上。于是即便终端需求没有爆发,图形DRAM供应也不见得宽松。
消费级DRAM就尴尬了。
电视、机顶盒、传统消费电子需求本来就弱,但主要供应商正在加速退出低利润消费级DRAM市场。供应端减少,订单被动转移,再叠加DDR4供给收缩,反而让价格继续获得支撑。这就是典型的“需求不好,但供应更少”。
NAND这边,结构分化也非常明显。
客户端SSD市场,上半年PC OEM已经囤了不少货。现在库存偏高,终端需求又一般,客户对新一轮涨价的接受度明显下降。供应商为了维持出货,只能在客户端SSD上更灵活定价。谈判周期会拉长,价格涨幅也会被压住。
但企业级SSD完全是另一套逻辑。
AI服务器、企业数据中心、云厂商部署仍然在吃掉大量高性能NAND。NAND厂商也很清楚,消费需求疲软的时候,最应该保的是企业级SSD产能,因为利润更高,客户也更愿意为确定性交钱。
不过企业级SSD也不是完全顺风。内部DRAM短缺仍然会限制一部分小容量、高性能企业级SSD供应。换句话说,NAND本身想多做企业级SSD,但配套DRAM不够,也会卡住一部分产品节奏。
手机存储方面,UFS和eMMC的压力相对缓和一些。
大多数手机品牌在2026年上半年已经完成了主要新品制造和零部件采购。到了下半年,真正还会带来明显UFS 4.0升级需求的,主要是旗舰机。中端和入门机的采购活动仍然偏弱。
所以此前供应非常紧的eMMC和UFS,第三季度会相对好一些。OEM对高成本的接受度下降,终端需求又不强,供应商的定价权自然会被削弱。
所以,回到最开始的问题:存储涨价终于要停了吗?
笔者的观察是:涨价应该不是停了,而是从“全面暴涨”,进入了“结构性上涨”。
🔹 AI相关的内存(HBM,LPDDR),服务器DRAM,企业级SSD,高性能NAND,仍然会需求强筋。
🔹 PC,手机,消费SSD,eMMC,UFS,零售的存储,会开始受到C端购买力约束。
🔹 特定的产品,低利润,传统的消费级产品,即便需求弱,也可能因为供应退出而继续涨。
是的,旧的周期结束了。新的周期,才刚刚开始。
五年计划正式出炉:电子信息制造业“十五五”规划释放了哪些信号?
9月15日,工信部、发展委正式联合印发了《电子信息制造业发展“十五五”规划》(工信部联规〔2026〕216号),给之后几年的电子信息产业画了一条清楚的路线图。
先说最实在的数字:到2030年,规模以上企业营业收入要突破30万亿元,研发投入强度达到3.5%。对比一下:2025年全行业营收是17.4万亿元,这意思就是五年内要再干出将近13万亿的增量。
当然,另外一个数据是,2026年上半年行业营收9.41万亿元,同比增长18.5%,增速远超去年全年。产业的加速度还是比较快的。
规划真正的分量,在技术路线图
规划明确提出“推进软硬协同和电子系统设备突破”,核心抓手有三个:开源鸿蒙等国产操作系统的搭载、RISC-V芯片的研发与产业化、以及芯模协同创新。
这三件事放在一起看,指向一个明确的目标:构建一套从操作系统到芯片架构再到AI算法全打通的技术栈,说白了,就是要解决之前国内电子信息产业“各干各的、互不兼容”的老问题。
当然,这里面最值得玩味的是RISC-V
RISC-V是一条开放指令集架构,不归属于某一公司。过去多年国内的大小企业一直在布局,但大多是“试试水”的阶段。这次规划把它单独拎出来,明确“支持RISC-V芯片在人工智能、嵌入式系统等领域应用”,信号意义很强。实际上产业端已经开跑了,RISC-V服务器在中国都进了量产阶段。截至目前,国产RISC-V芯片整体量产率已超过90%。
开源鸿蒙也同样在加速。截至2026年8月,搭载HarmonyOS 6的终端设备已突破8000万台,预计四季度破亿。更关键的是,开源鸿蒙已衍生出电鸿、工鸿、移鸿等100多个行业发行版,渗透到金融、工业、交通、医疗、能源等国计民生领域。从消费端到产业端的跨越已经完成。
规划还释放了一个容易被忽略的信号:计算范式正在被重新定义。
文件提出布局存算一体、量子计算、光计算、类脑计算,甚至把太空计算也写进了正式规划,支持数十万卡级人工智能集群建设。
在工业领域,规划提出“算控感传一体化工业计算体系”,把感知、计算、控制、通信四个环节在系统层面打通。
对于更多产业链上的企业来说,未来五年最大的机会不一定在某个单点技术突破,而在于能不能找准自己在“全栈生态”里的位置:是做芯片的、做操作系统的、做算法的,还是把三者整合起来的那个人。
信息通信“十五五”规划出炉:首增“先进存力”指标,算力投资与行业年收入同量级
这几天的信息有点多。同样是昨日9月7号,科技股票大涨,因为工业和信息化部正式印发《信息通信行业发展“十五五”规划》,以13项主要指标勾勒出未来五年的发展蓝图。
新华社当日披露了规划要点,尽管3.8万亿元的基础设施规模备受瞩目,但笔者和朋友们比较关注的是指标体系中首次出现的两项全新维度:其中“先进存力”的入列,标志着存储能力正式上升为国家信息基础设施的硬性考核指标。
投资规模加大,行业收入显著增加
规划明确:到2030年,全行业收入目标为4.1万亿元,而五年累计信息基础设施投资额达3.8万亿元。这表明未来五年行业将进入高强度资本开支与产出同步扩张的阶段。
这一体量远超“十四五”期间的投资规模。
智算算力目标跃升6.2倍,十万卡集群首入部级规划
在算力维度上,规划设定智算算力规模到2030年达到9800 EFLOPS,而截至2026年1月,该数值仅为1590 EFLOPS。据此计算,四年间需实现约6.2倍增长,年均复合增长率接近57%。
当前国内已建成万卡级算力集群42个,而规划首次在部级文件中明确要求部署十万卡及以上超大规模集群,为算力基础设施的建设指了明确的方向。
当然,这需要两条技术路径同时发力:一是依靠单卡算力性能升级,从而摊薄单位算力的电力与机房成本;二是通过集群数量扩张,从现有42个万卡集群向十万卡集群演进。
如这几天讨论的华为的突破,前者依赖于先进制程芯片的供应与国产化进程;而后者则将直接拉动液冷散热、高功率供电等配套产业的刚性需求。
“先进存力”首次列为考核指标,算存协同成新焦点
在13项指标的基础设施类子项中,除每万人5G基站数、50G-PON端口数、智能算力规模外,新增了“先进存力规模”指标。
这是存储能力指标首次被纳入信息通信行业五年规划,意味着政策层面对“算存协同”的重视提升至全新高度。规划正文亦明确提出鼓励算力与存力协同发展,暗示未来投资将向高效存储系统、存算融合架构等方向倾斜。
这个,长鑫和长存这把不是要上去啦?
网络升级重心转向存量优化,点名多项关键技术
对比“十四五”规划,每万人5G基站数目标从26个提升至50个,接近翻倍。但规划措辞强调“老旧网络焕新升级”,表明新增基站并非简单重复建设,而是侧重于现有网络的质效提升。
规划直接点名的技术环节包括:400G以上光传输系统、100G光网向接入层下沉、50G-PON无源光网络,以及液冷散热与余热回收等绿色节能技术。同时,PUE(电能利用效率)和碳排放降幅硬性约束的强化,将使液冷技术从可选方案逐步演变为新建数据中心的准入条件。
好吧,光模块和液冷涨的好是有原因的。
在笔者看来,后续可重点关注万卡集群数量的季度披露、50G-PON端口累计建设数,以及新开工算力设施的PUE设计值。这些量化数据将成为检验规划执行进度的先行指标。
此次“十五五”规划以“先进存力”和“十万卡集群”为标志性信号,预示着中国信息通信业正从单纯的连接规模扩张,转向算力、存力、网络能力协同提升的高质量发展新阶段。
哈哈哈,大概率资本的流向也将随之聚焦于高端芯片、高速光模块、绿色能源等核心赛道。
深圳超算宣布入围2026年ACM戈登贝尔奖:实现两亿原子DFT计算,关键阶段性能突破E级
据国超计算深圳中心消息:徐奇门、张羽、付昊桓、卢宇彤等研究人员参与研发的XLSDFT计算软件成果入围2026年ACM戈登贝尔奖。
该项目依托国产“灵晟”超级计算机,将Kohn–Sham密度泛函理论(DFT)计算规模推进至两亿原子,并完成千万原子级固态电池界面模拟,为量子力学计算连接实验相关尺度提供了新的技术路径。
DFT是预测材料电子结构与性质的核心方法。传统Kohn–Sham DFT算法的计算量和内存需求通常分别随体系规模呈三次方、平方增长,限制了其对大规模复杂材料的直接模拟能力。XLSDFT结合单粒子密度矩阵的分治分解与切比雪夫滤波子空间迭代,在所研究体系和精度要求下,实现计算与存储复杂度的线性标度,大幅降低规模扩展的资源成本。
XLSDFT在20,480个计算节点上完成一亿原子体系扩展测试,弱扩展效率达到96.6%;进一步完成的两亿原子硅晶体计算,规模达到此前千万原子纪录的20倍。性能方面,团队报告关键计算阶段的FP64峰值达到1.31 EFlop/s,即每秒131亿亿次双精度浮点运算;SC26公开摘要则列出一亿原子扩展研究的持续FP64性能为157.9 PFlop/s。两项指标衡量的计算范围不同,E级峰值应限定于所报告的关键阶段。
在科学应用层面,团队完成了约1133万个原子的锂金属与硫化物固态电解质LGPS界面DFT计算。据团队介绍,其规模较此前同类复杂界面研究扩大约三个数量级,使电子结构计算能够覆盖更接近实验表征尺度的界面体系,为研究全固态电池界面反应提供支撑。
前几个月,“灵晟”已位列TOP500与HPCG榜首。XLSDFT的进展进一步展示了国产超算通过算法、应用软件与系统协同,将大规模计算能力用于前沿材料研究的潜力。
正在德国汉堡举行的ISC 2026大会公布了最新IO 500榜单,两套国产系统延续强势,再度霸榜
哈哈哈,主持人说:我们可不是专门针对中国人颁奖的,大家都可以来提交的。 😍😍
正在德国汉堡举行的ISC 2026(6月22日至26日)是欧洲规模最大,历史最悠久的高性能计算与人工智能盛会。
大会聚焦新一代超级计算机体系架构,AI大模型算力,量子技术集成等前沿趋势,吸引了全球顶尖科学家和科研机构与行业企业齐聚展示。
继昨日深圳超算的LineShine登顶全球超级计算TOP 500榜单之后,国产的两台系统在今天发布的IO 500榜单上再度展现统治力,延续强势领跑地位。
第一个:SCNet AICS的ParaStor在IO 500榜单排名第一,领先于之前基于Intel DAOS平台的系统。ParaStor由中科曙光研发,该系统经过二十余年的自主研发,现广泛应用于科学计算和AI大模型训练等超高算力场景。此次夺冠的曙光ParaStor F9000全闪存储包揽“生产型全节点”和“10节点”双料冠军,成为首个达成此成就的系统。
第二个:鹏城实验室的人工智能大科学装置——“鹏城云脑Ⅱ”依托高度优化的SuperFS大规模分布式文件系统,其性能指标与数据吞吐能力惊人,曾连续10年蝉联IO 500“研究型全节点”的冠军。
今年的鹏城云脑更是更新了华为的OceanStor存储,用OceanFS分布式文件系统打破了自己保持多年的记录,在IO 500“研究型全节点”的排名上,以差不多之前三倍的新得分继续夺冠,更是显著拉大了与之前海外系统的距离。