DeepSeek 發布 V4.1-Flash 模型並啟動上海 IPO 準備
中國人工智慧公司 DeepSeek 發布具備原生多模態能力的 DeepSeek-V4.1-Flash 模型,該模型採用 Mixture of Experts 架構,參數規模為 5520 億,並透過優化預訓練與強化學習提升了效能與成本效益。此外,該模型大幅降低了 KV 快取需求,並已開放 API 使用。同時,DeepSeek 已聘請中信證券(CITIC Securities)協助其在上海證券交易所科創板(STAR Market)進行首次公開募股(IPO)的準備工作。
摘要由 AI 依據原文撰寫,並非投資建議。