【王者自助下单24小时平台】芯展速AI90亮相WAIC 2026:以“存算协同”打破AI显存墙,释放Token效能

/涨粉易/2026 WAIC 芯展速张江馆展区
7月17日,存算协同2026世界人工智能大会(WAIC)在上海开幕。芯展相WI显n效芯展速在张江展区三展位及世博论坛同步亮相,速A释放王者自助下单24小时平台正式发布 AI90 —— FaaS(Flash as a Service) for AI 架构,存墙引发业内广泛关注。存算协同
芯展速

芯展速产品VP-许玮 于 2026 WAIC发表重要内容
芯展速产品副总裁许玮在演讲中指出:近二十年 GPU 算力提升约60.000倍,芯展相WI显n效而显存容量仅增长16倍、速A释放带宽仅增长30倍,存墙算存严重失衡导致主流 GPU 有效算力利用率仅30% - 60%。存算协同

2026 WAIC 芯展速张江馆展区
而芯展速本次发布的芯展相WI显n效 AI90 架构,通过将 KV Cache 从 HBM 卸载至高性能 SSD,速A释放构建 HBM + DRAM + SSD 三级存储体系,存墙智能 P2P 互联技术优化了 GPU 间数据通路,存算协同王者自助下单24小时平台跨卡数据传输时无须CPU 和主机内存搬运,芯展相WI显n效实现 GPU 间高效直连。速A释放让消费级 GPU也能高效承载大模型推理,释放 token 效能。
AI
在芯展速张江展区,工作站现场运行搭载消费级 GPU 与 AI90 SSD 的推理系统,直观展示「用消费级显卡跑大模型」的技术突破。

在Llama 3 70B 模型推理场景下:
• 4卡5090集群搭配 AI90 方案,吞吐量从约 120 tk/s 跃升至 6 10 tk/s,提升5.1倍。
• 首 Token 延迟在 64K 上下文下从27.99秒降至0.564秒,提升近50倍。
• 显存利用率从30% - 40%提升至85% - 95%,提升2 - 3倍。
同步发布的支撑该方案的核心硬件 PT200Z AI SSD 采用 PCIe Gen5 接口与 pSLC 介质,DWPD 最高达100.专为 KV Cache 高频写入场景优化。
媒体专访:AI90以「
芯展速产品副总 - 裁许玮强调,AI 推理正从短上下文向长上下文、多轮对话加速演进,KV Cache 已成为核心瓶颈。「AI90 的本质,是把存储变成算力的放大器。」

芯展速产品VP 许玮 接受媒体采访
“Token 经济的本质,是谁的单位 Token 成本更低,谁就能赢。” 许玮以这句话结束演讲,“芯展速的目标,就是让每一块钱的算力投资,产出更多的Token。”
演讲完毕,现场掌声雷动。会后钛媒体、DOIT 等媒体对芯展速技术团队就 AI90 的部署场景、兼容性及落地路径对许玮及芯展速团队进行了深度专访。
结语
WAIC 2026 上芯展速AI90 的亮相,不仅验证了消费级GPU跑大模型的工程可行性,更标志着 AI 推理从「算力独大」逐步走向「存算并重」。
当行业仍在为 HBM 的稀缺产能支付溢价时,芯展速 AI90 解决方案借助高效能的 AI SSD 存储平抑算力成本;这正是 Token经济时代,打破显存瓶颈的破局路径。
相关推荐
延伸阅读:
小红书吸引人的昵称|小红书账号昵称取名思路,提升搜索辨识度技巧
微信公众号通过视频涨粉|公众号存量粉丝导流视频号涨粉实操方案
零基础快手涨粉秘籍:从0到万粉完整运营教程,轻松成热门创作者!
2026抖音直播权限新规:有效粉丝成核心,开通路径与涨粉技巧揭秘
抖音里刷粉|抖音站内私信刷粉广告识别 黑产引流话术与防骗实操办法
短视频标题怎么写容易上热门|全平台短视频爆款标题通用创作技巧
快手怎么迅速涨粉|抓住平台自助下单平台流量扶持窗口期快速涨粉
抖音里刷粉|抖音站内私信刷粉广告识别 黑产引流话术与防骗实操办法
抖音开橱窗绑定银行卡|橱窗佣金提现银行卡绑定解绑完整操作流程
【揭秘】微信公众号涨粉攻略:一天涨粉多少算正常?涨粉技巧全解析!
抖音短视频突破初始流量池|短视频突破初始流量池实操方法与数据标准
快手直播间点赞多少有推流|快手直播间点赞数据对流量分发影响解析
【小红书加粉攻略】揭秘快速增粉秘诀,笔记过万粉丝技巧大公开!
本文标题:【王者自助下单24小时平台】芯展速AI90亮相WAIC 2026:以“存算协同”打破AI显存墙,释放Token效能
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。 如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至页底联系我们举报,一经查实立刻删除。