
A | 8 月 26 日消息,科技媒体 Tom's Hardware 昨日(8 月 25 日)发布博文,报道称 AI 计算爱好者 Angel 展示了一段视频,在 GPT-5.6 Sol 定制的 CPU Codex-R32 上,成功运行《毁灭战士》(Doom)游戏。

B |
白皮书指出,大模型输入上下文规模进入百K至1M级别后,Prefill(预填充,计算密集型)与Decode(解码,访存密集型)在同一资源池混跑造成结构性算力错配。示意图展示了处理器门电路、寄存器、内存、算术逻辑单元(ALU)等模块,界面还实时显示周期计数器、模拟速度以及内存和寄存器数值。演示运行的《毁灭战士》使用 C 语言编写的 PureDOOM 移植版,并编译为原生 RV32IM 机器码,直接运行在 Codex-R32 上。

C | 解决方案是将二者彻底解耦,分别运行在各自最契合的硬件资源池上,实现单位Token基础设施成本大幅下降。

D | MTT S5000硬件特性与Prefill任务高度契合:提供高稠密算力压缩首字时延,原生支持FP8全精度计算,并全面兼容CUDA及PyTorch、vLLM等主流推理框架。实测数据显示,在64K上下文场景下,单机Prefill吞吐达95,920 tok/s,按智谱API定价测算,满负载下单机月收入可达64.6万元;400K极限长序列场景TPM达2.6MTokens,吞吐平稳可控。

E | 摩尔线程表示,大模型产业竞争下半场本质上是推理效率与商业回报的较量,该方案旨在帮助企业在万亿参数与Agent时代降低总拥有成本。完整白皮书已在官网发布。
Current article:http://8tee.zhuankaizhuohangwangdixi.shop/kevqs/20260826/7669144.html
Published on:00:00:00