DeepSeek planeja treinar modelo de 8 trilhões de parâmetros
O CEO da DeepSeek, Liang Wenfeng (梁文锋), revelou a investidores que a empresa está treinando um modelo de 2 trilhões de parâmetros e planeja desenvolver um modelo de 8 trilhões no futuro. O atual modelo principal, V4-Pro, possui 1,6 trilhão de parâmetros. A DeepSeek, que recentemente levantou mais de 50 bilhões de yuans com uma avaliação superior a 50 bilhões de dólares, busca superar a escala do Kimi K3 da Moonshot AI (2,8 trilhões de parâmetros).
Os resumos são escritos por IA a partir do artigo original. Não é recomendação de investimento.