登录 注册 退出
博客 AI资讯+
热门搜索: 2024 坍塌之后

标签:AI推理

共 8 篇文章
IBM拿下2.4亿美元Together AI订单,HGX B300推理集群2027年上线 AI

IBM拿下2.4亿美元Together AI订单,HGX B300推理集群2027年上线

IBM与Together AI签署2.4亿美元多年期协议,在IBM Cloud部署NVIDIA HGX B300推理集群,预计2027年Q1上线。这是IBM C......

普思AI资讯 1星期前 8 阅读
Gartner预测2026年AI推理支出首次超越模型训练,AI正式进入生产阶段 AI

Gartner预测2026年AI推理支出首次超越模型训练,AI正式进入生产阶段

Gartner预测2026年全球AI推理支出将达233亿美元,首次超过训练支出的190亿美元。推理占AI优化IaaS支出的55%,标志着AI产业从模型研发竞赛正......

普思AI资讯 1星期前 4 阅读
英伟达让KV缓存学会“串门”:跨模型迁移提速25倍,AI推理的“重复造轮子”时代结束了 AI

英伟达让KV缓存学会“串门”:跨模型迁移提速25倍,AI推理的“重复造轮子”时代结束了

英伟达研究团队提出KV缓存跨模型迁移方法,让目标模型直接复用源模型缓存、跳过预填充。Qwen3 14B32B实测中,转换仅需0.28秒(原7秒),提速25倍。适......

普思AI资讯 1星期前 6 阅读
谷歌秘密研发Frozen v2芯片:把Gemini“刻”进硅片,每瓦Token翻10倍 AI

谷歌秘密研发Frozen v2芯片:把Gemini“刻”进硅片,每瓦Token翻10倍

谷歌秘密研发Frozen v2芯片,将Gemini模型架构直接固化于硅片,单位功耗Token处理量达现有TPU的6至10倍,最早2028年部署。独立于TPU产品......

普思AI资讯 1个月前 18 阅读