IBM与Together AI签署2.4亿美元多年期协议,在IBM Cloud部署NVIDIA HGX B300推理集群,预计2027年Q1上线。这是IBM C......
Gartner预测2026年全球AI推理支出将达233亿美元,首次超过训练支出的190亿美元。推理占AI优化IaaS支出的55%,标志着AI产业从模型研发竞赛正......
英伟达研究团队提出KV缓存跨模型迁移方法,让目标模型直接复用源模型缓存、跳过预填充。Qwen3 14B32B实测中,转换仅需0.28秒(原7秒),提速25倍。适......
谷歌秘密研发Frozen v2芯片,将Gemini模型架构直接固化于硅片,单位功耗Token处理量达现有TPU的6至10倍,最早2028年部署。独立于TPU产品......