产品 +

iEnter|智慧企业 +

企业资源计划管理系统

智钉

iManu|智能制造 +

制造执行系统

物流执行系统

高级计划及排程

iSupply|智慧供应链 +

运输管理系统

仓储管理系统

供应商关系管理系统

EP|智慧生态营销 +

经销商管理系统

全面营销管理系统

客户关系管理系统

Connect|智能网联 +

智能网联云平台

新能源汽车监控平台

商用车企业监控平台

电检系统

行驶记录仪

车载T-BOX

汽车故障诊断仪

国六OBD产品

后装GPS产品

DataValue|数据价值赋能 +

智慧质量

线索运营

智慧广告

Platform|云原生PaaS平台 +

云原生PaaS平台

容器引擎(QKP)

AI智能服务平台

API网关平台

低代码平台-QLCP

元宇宙技术探索平台

数据中台

智能运维平台

服务 +

咨询 +

车路协同解决方案

IT咨询

云原生技术架构规划与咨询服务

评测 +

网络安全等级保护测评

实施 +

电子电气检测服务

网联产品组装制造

运维 +

桌面及外围设备运维服务

云服务(IDC)

销贷服务

乘用车车联网运营服务

商用车车联网运营服务

客户联络中心运营服务

数据价值运营服务

K8s运维

关于半岛(bandao·中国)官方网站-BANDAO SPORTS +

企业简介 +

企业简介

企业价值 +

企业荣誉

行业地位

资质认证

社会责任 +
企业文化 +
投资者关系 +
麾下企业 +
加入半岛(bandao·中国)官方网站-BANDAO SPORTS +

业务发展规划

福利待遇

人才招聘

信息公开 +

企业基本信息 +

企业概况

经营范围

市场主体登记基本信息

组织机构

成员单位

资质荣誉

企业重大事项 +

股权信息

产权信息

研发成果

企业经营管理 +

财务与经营状况

品牌与产品

安全环保 +

安全信息

招标招募 +

招标信息

人力资源 +

招聘信息

社会责任 +
企业公告 +

上市公司

公告信息

投资者关系

加入半岛(bandao·中国)官方网站-BANDAO SPORTS

客户留言

bandao.com半岛(bandao·中国)电子科技-摩尔线程发布《MTT S5000 Prefill
2026-08-26 12:39:51

  摩尔线程发布《MTT S5000 Prefill-as-a-Service技能白皮书》,给了一个算力分层方案

发布时间:2026-08-24 来历:转载 责任编纂:Lily

【导读】摩尔线程近来发布了一份技能白皮书,缭绕MTT S5000智算卡提出了一个叫“Prefill-as-a-Service”的方案。焦点逻辑不繁杂:年夜模子推理有两个阶段,Prefill算力密集型,Decode访存密集型,放于统一套硬件上跑一定互相华侈。摩尔线程的做法是把二者拆开,各跑各的资源池,MTT S5000专门卖力Prefill这一端,用高浓厚算力及原生FP8撑持来压榨首字时延。

202608240441089016.png

配景:长上下文时代,“算力错配”成为推理成本的焦点瓶颈

跟着年夜模子输入上下文范围快速迈入数百K到1M 级别,长文本输入带来的算力耗损与首字时延压力连续爬升,正日趋成为制约企业推理办事效率与总拥有成本(TCO)的要害瓶颈。传统同构集群的算力部署模式,已经难以应答差别计较阶段对于硬件资源的差异化需求。

焦点痛点于在布局性错配:于年夜模子于线推理中,输入阶段的Prefill(预填充)属计较密集型使命,受浮点算力约束;输出阶段的Decode(解码)属访存密集型使命,受显存带宽约束。二者于统一物理资源池中混跑,一定致使双向华侈——按Decode带宽选型,则Prefill的年夜容量显存持久低效;按Prefill算力选型,则Decode计较单位年夜面积空转。

破局:Prefill-Decode异构解耦,重构推理资源池

《白皮书》指出,冲破这一瓶颈的要害于在将Prefill与Decode完全解耦,使两者各自运行于最契合自身计较特征的硬件资源池上:

Prefill算力池:专攻高算力使用率与极低首字延迟(TTFT);

Decode资源池:专攻高并发与不变的每一Token延迟(ITL)。

经由过程硬件分层投入,算力配置从“通用冗余”转向“按需匹配”,于满意办事质量(SLO)约束的条件下,实现单元Token基础举措措施成本年夜幅降落。

底座:MTT S5000修筑高吞吐Prefill专属算力池

作为一款全功效通用AI加快卡,MTT S5000于硬件特征上与Prefill使命高度契合,揭示出精彩的工程适配与范围化落地能力:

高计较密度,压缩首字时延。针对于Prefill的计较密集型特性,MTT S5000提供高浓厚算力,有用压缩首Token天生时延(TTFT);于长上下文场景下,以GLM-5.2为例,单机8卡可实现靠近十万级Prefill吞吐,为Agent、长文档阐发等营业提供确定性的SLO承诺与容量计划能力。

原生FP8撑持,消弭格局转换开消。撑持FP8至FP64全精度计较,自然适配主流年夜模子原生精度,Prefill历程不引入分外精度损耗;原生FP8 KV Cache与Decode池连结高度兼容,消弭跨节点传输前的格局转换成本,显著降低KV Cache传输时延。

生态成熟兼容,降低沉地门坎。依托MUSA软件生态,周全兼容CUDA和PyTorch、SGLang、vLLM等主流推理框架,企业可基在现有代码资产实现光滑迁徙与快速适配。

实考试证:严苛SLO约束下,64K上下文场景单机吞吐可到达5.8 MTokens TPM

《白皮书》基在超年夜参数模子智谱GLM-5.2-FP8,于90%前缀缓存掷中率、首字时延P50 TTFT ≤ 6,000ms的严苛硬性SLO约束下,完成为了64K至400K序列的极限压测。

以智谱官网API订价为基准(输入8元/百万Token、缓存掷中2元/百万Token,综合单价2.6元/百万Token)举行测算,基在实测机能,于抱负状况下的贸易价值体现以下:

ScreenShot_2026-08-24_173506_362.png

于典型Agent混淆上下文负载下,单机更具确定性算力变现能力与清楚的投资收受接管周期。

结语:以“推理效率+贸易回报”重构财产竞争逻辑

年夜模子财产竞争的下半场,素质上是推理效率与贸易回报的较劲。摩尔线程经由过程MTT S5000与Prefill-as-a-Service方案,不仅重塑了长上下文推理的机能与成本界限,更帮忙企业于万亿参数与Agent时代紧紧把握TCO自动权。

完备白皮书请拜见:《MTT S5000 Prefill-as-a-Service技能白皮书》

https://developer-hscdn.mthreads.com/public/MTT-S5000-Prefill-as-a-Service-%E6%8A%80%E6%9C%AF%E7%99%BD%E7%9A%AE%E4%B9%A6.pdf

总结

从技能路径来看,Prefill及Decode解耦不是甚么新观点,业内早有会商,但真正拿出详细硬件方案及实测数据的还有未几。摩尔线程此次把MTT S5000卡于Prefill这个节点上,等在给算力分层提供了一个可落地的参考。实测数听说明于长上下文场景下,这套打法能于SLO约束下跑出不变的吞吐,并且用FP8精度跑起来没有分外的格局转换开消,生态上也兼容了主流框架及CUDA代码。

gg_20260512171736_266_20260622170931_179.png

-bandao.com半岛(bandao·中国)电子科技


地址:长春净月高新技术产业开发区百合街1009号

版权所有:半岛(bandao·中国)官方网站-BANDAO SPORTS信息技术股份有限公司

电话:0431-85861717/ 4001182299