续测ROCm驱动——Unsloth Desktop测试(AMD Ryzen AI MAX+395)

昨天测试了Vulkan驱动下,Unsloth Desktop加载其独有的Unsloth Dynamic 3.0 GGUFs模型文件Qwen3.8-27B-UD-Q4-K-XL,思考模式设置为medium中等。我们测试多种模式,包括MTP、DSPark、Dflash、Ngram、MTP+Ngram,以及Off,共6种模式下的结果。

今天我们继续测试ROCm驱动下,Unsloth Dynamic 3.0 专属大模型文件Qwen3.8-27B-UD-Q4-K-XL,思考模式设置为medium中等。测试多种模式,包括MTP、DSPark、Dflash、Ngram、MTP+Ngram,以及Off,共6种模式下的结果。

整体的硬件和操作系统环境

Windows 11 专业版,版本号 25H2,功能包 Windows 功能体验包 1000.26100.344.0

CPU/GPU:AMD RYZEN AI MAX+ 395 w/ Radeon 8060S “,16核32线程。

内存/显存:128GB(64GB+64GB)

其他环境版本号等详细见如下截图。

Ryzen AI_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis Ryzen AI_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Ryzen AI

MTP模式:

设置中启用MTP,其他参数如下:

MTP测试结果:

Ryzen AI_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison Ryzen AI_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison

显存不是直接使用专用显存,而是使用共享显存,从截图中可以看出,加载大模型文件时候,专用显存的曲线几乎没变,而共享显存从0到了36.8GB。系统内存的加载曲线也可以看出对应关系完全吻合。

这个是跟Vulkan有着非常大的区别的!后续的截图就看GPU的

Ryzen AI_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison

文本模式下,与之前测试一样的提示词和要求生成短篇小说,思考时间用了18秒,推理的Token输出速率为14.5token/s。与Vulkan对比起来快了点。

DSpark模式:

设置中选择DSpark,其他参数一样:

Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Ryzen AI

DSpark测试结果:

Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Ryzen AI

GPU显存使用了共享显存34.2GB。

Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Ryzen AI_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison

思考时间用了14秒,快了点。推理的Token输出速率为10.9token/s,慢了很多。

DFlash模式:

设置中选择DFlash,其他参数一样:

Ryzen AI_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison

DFlash测试结果:

Ryzen AI_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison

GPU显存使用了共享的34.3GB。

Ryzen AI_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis

思考时间用了25秒,慢了很多。推理的Token输出速率同样为10.9token/s。

Ngram模式:

设置中选择Ngram,其他参数一样:

Ngram测试结果:

Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Ryzen AI

GPU显存使用了共享的34.3GB。

Ryzen AI_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison

思考时间用了18秒。推理的Token输出速率同样为10.9token/s。

MTP+Ngram模式:

设置中选择MTP+Ngram,其他参数一样:

Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Ryzen AI

MTP+Ngram测试结果:

Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Ryzen AI_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis

GPU现存使用了共享36.8GB。

Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Ryzen AI

思考时间用了15秒。推理的Token输出速率同样为13.2token/s。

Off模式:

设置中选择Off,其他参数一样:

Off模式测试结果:

Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Ryzen AI

GPU显存使用了共享的34.2GB。

Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis_Ryzen AI

思考时间用了22秒。推理的Token输出速率同样为13.2token/s。

小结:ROCm驱动下6种模式的GPU显存使用及思考时间和推理速度的结果比较。

Ryzen AI_Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis

从测试结果看来,思考时间上,DSpark的14秒领先,而推理速度是MTP的14.5Token/S领先。

总结:Vulkan与ROCm不同驱动下六种场景的全面比较结果。

在 CPU 模式下则无需进行测试,鉴于其性能相较 Vulkan 和 ROCm 模式显著滞后已属默认情形,故而该模式不会作为实际工作场景的选用方案。

与昨天的Vulkan测试结果放一起,12组数据一比较,最终的结果就是Vulkan驱动下的MTP+Ngram模式最优!其思考时间为领先的11秒;同样的推理速度也是领先的18.5Token/s。

Unsloth Dynamic 3.0 GGUFs model Vulkan ROCm comparison_Ryzen AI_Unsloth Dynamic 3.0 27B-UD-Q4-K-XL ROCm driver performance analysis
© 版权声明

相关文章

暂无评论

none
暂无评论...