Zhipu AI lança GLM-5.3-FlashX com velocidade de inferência de até 200 tokens/s
A Zhipu AI (智谱) lançou o modelo GLM-5.3-FlashX, que já está disponível em sua API e centro de experiência. A empresa afirma que o modelo atinge uma velocidade de inferência de até 200 tokens/s, resultado de investimentos em infraestrutura e otimização de inferência utilizando 100 mil chips nacionais. O modelo base, GLM-5.3-Flash, possui 320 bilhões de parâmetros totais e 18 bilhões de parâmetros ativos, com suporte para uma janela de contexto de 1 milhão de tokens.
Os resumos são escritos por IA a partir do artigo original. Não é recomendação de investimento.