ai - 本地部署大模型的一些思考,感觉落地还是难

访问量: 8

refer to:

嗯,前几天运行了千问3.827B用的是本地的显卡308020 G. 先说结论,第一,速度慢,3080不加MTP每秒钟大概是10~15个token,加了MTP稳定在15~20个token,但前提是上下文长度只有36K,这是干啥都不够啊,而且显存爆满,20G吃满了。第二,只能开单线程访问,一旦用户端发起10个8个请求,全挂只有一个。第三,一旦上下文长度超过了33K,那就完犊子了,不具备实战价值,想升级卡,费用层面出现了下面的问题,第三显卡产品每一代之间有鸿沟般的差距,308020 G, 三千五四零九零一万5~二万五零九零五万还不是48G魔改版只是32G5090,所以就算硬件层面,从我现在的308020 G升级到509048 G的魔改版,也就是Paul千问三点八二十七B,大概3~5个slot每秒钟50个token,并且上下文不支持26万。

订阅/RSS Feed

Subscribe