昨天测试了Vulkan驱动下,Unsloth Desktop加载其独有的Unsloth Dynamic 3.0 GGUFs模型文件Qwen3.8-27B-UD-Q4-K-XL,思考模式设置为medium中等。我们测试多种模式,包括MTP、DSPark、Dflash、Ngram、MTP+Ngram,以及Off,共6种模式下的结果。
今天我们继续测试ROCm驱动下,Unsloth Dynamic 3.0 专属大模型文件Qwen3.8-27B-UD-Q4-K-XL,思考模式设置为medium中等。测试多种模式,包括MTP、DSPark、Dflash、Ngram、MTP+Ngram,以及Off,共6种模式下的结果。
整体的硬件和操作系统环境
Windows 11 专业版,版本号 25H2,功能包 Windows 功能体验包 1000.26100.344.0
CPU/GPU:AMD RYZEN AI MAX+ 395 w/ Radeon 8060S “,16核32线程。
内存/显存:128GB(64GB+64GB)
其他环境版本号等详细见如下截图。
MTP模式:
设置中启用MTP,其他参数如下:
MTP测试结果:
显存不是直接使用专用显存,而是使用共享显存,从截图中可以看出,加载大模型文件时候,专用显存的曲线几乎没变,而共享显存从0到了36.8GB。系统内存的加载曲线也可以看出对应关系完全吻合。
这个是跟Vulkan有着非常大的区别的!后续的截图就看GPU的
文本模式下,与之前测试一样的提示词和要求生成短篇小说,思考时间用了18秒,推理的Token输出速率为14.5token/s。与Vulkan对比起来快了点。
DSpark模式:
设置中选择DSpark,其他参数一样:
DSpark测试结果:
GPU显存使用了共享显存34.2GB。
思考时间用了14秒,快了点。推理的Token输出速率为10.9token/s,慢了很多。
DFlash模式:
设置中选择DFlash,其他参数一样:
DFlash测试结果:
GPU显存使用了共享的34.3GB。
思考时间用了25秒,慢了很多。推理的Token输出速率同样为10.9token/s。
Ngram模式:
设置中选择Ngram,其他参数一样:
Ngram测试结果:
GPU显存使用了共享的34.3GB。
思考时间用了18秒。推理的Token输出速率同样为10.9token/s。
MTP+Ngram模式:
设置中选择MTP+Ngram,其他参数一样:
MTP+Ngram测试结果:
GPU现存使用了共享36.8GB。
思考时间用了15秒。推理的Token输出速率同样为13.2token/s。
Off模式:
设置中选择Off,其他参数一样:
Off模式测试结果:
GPU显存使用了共享的34.2GB。
思考时间用了22秒。推理的Token输出速率同样为13.2token/s。
小结:ROCm驱动下6种模式的GPU显存使用及思考时间和推理速度的结果比较。
从测试结果看来,思考时间上,DSpark的14秒领先,而推理速度是MTP的14.5Token/S领先。
总结:Vulkan与ROCm不同驱动下六种场景的全面比较结果。
在 CPU 模式下则无需进行测试,鉴于其性能相较 Vulkan 和 ROCm 模式显著滞后已属默认情形,故而该模式不会作为实际工作场景的选用方案。
与昨天的Vulkan测试结果放一起,12组数据一比较,最终的结果就是Vulkan驱动下的MTP+Ngram模式最优!其思考时间为领先的11秒;同样的推理速度也是领先的18.5Token/s。