• 请不要在回答技术问题时复制粘贴 AI 生成的内容
ashong
V2EX  ›  程序员

编程效果对比 本地 Qwen3.8-27B vs Deepseek

  •  
  •   ashong · Aug 21 · 5469 views

    提示词

    需要一个 svg 动画页面, 内容为一只鹈鹕骑自行车。要求:
    - 鹈鹕生动形象
    - 关节运动要自然、不生硬
    

    除了 Deepseek 网页版,其他都是用 Deepseek Harness.

    Qwen 模型均来自 unsloth

    模型 缓存量化(ctk:ctv) 耗时 轮数 平均输出速度 t/s 缓存命中率% 总输入 总输出 预览 费用(元)
    Deepseek 网页 - 12 分 32 秒 2 - - - - https://dspage.previewship.net/ 0
    Deepseek Flash - 38 分 27 秒 1 123 99 11.9M 266K https://dsflash.previewship.net/ 1.93
    Qwen3.8 27B Q5_K_M q8_0:q4_0 5 分 52 秒 1 77 98 95.5K 26.5K https://q5kmq8q4.previewship.net/ 0.02
    Qwen3.8 27B Q5_K_M q8_0:q8_0 23 分 20 秒 1 69 98 818K 111K https://q5kmq8q8.previewship.net/ 0.09
    Qwen3.8 27B Q4_K_M q8_0:q8_0 16 分 13 秒 1 63 94 631K 67.7K https://q4kmq8q8.previewship.net/ 0.06
    Qwe3.8 27B UD_Q4_K_XL q8_0:q8_0 16 分 59 秒 1 58 94 131K 57.8K https://udq4kxlq8q8.previewship.net/ 0.06

    电费按 0.5 元/度计算

    提示词语义比较模糊, 所以思考时长会多一些

    本地环境

    硬件:7900xtx

    系统:ubuntu 26.04

    软件: llama.cpp + vulkan

    更喜欢哪一个结果?

    Supplement 1  ·  Aug 23
    Qwen3.8 27B 的模板会导致过度思考且容易陷入思考循环,用这个模板速度会快很多,tokens 消耗也更少。

    https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates
    33 replies    2026-08-22 12:34:38 +08:00
    woodfizky
        1
    woodfizky  
       Aug 21
    dsflash 怎么是倒着蹬啊(恼
    而且自作主张给你加了倍速调节。。
    towser
        2
    towser  
       Aug 21
    看起来 27b 运行的还可以,超过我的预期
    ashong
        3
    ashong  
    OP
       Aug 21
    @woodfizky 迷惑啊, 等谷期再用 Pro 版试一下
    sentinelK
        4
    sentinelK  
       Aug 21
    这种纯视觉效果的 deepseek 吃了没视觉能力的亏,没法重复验证。
    我的实际运行体验,确实 qwen3.8-27B 至少是能生产的。只是 256k 上下文稍短。

    如果不是要跑 Minimax H3 总是倒腾显存,我就让 sglang+27B-fp8 常驻显存了
    1258
        5
    1258  
       Aug 21
    flash 想的太多了吧
    ashong
        6
    ashong  
    OP
       Aug 21
    @towser 能力可以,配合 dsh 比 opencode 效果好一些
    yagamil
        7
    yagamil  
       Aug 21
    运行起来 A 卡和 N 卡去吧大吗?
    是不是只要显存大就行了?
    ashong
        8
    ashong  
    OP
       Aug 21
    @sentinelK 模型不支持,harness 自动下载安装了 pillow 截图,对比像素,其实之所以用了这么长时间就是验证耗时太长, 实际生成也就 10 分钟, 后续的验证修改了个寂寞
    ashong
        9
    ashong  
    OP
       Aug 21
    @yagamil 没 N 卡, 只有一张 7900xtx , 显存肯定越大越好
    sentinelK
        10
    sentinelK  
       Aug 21
    @ashong 有种说法是说,多模态模型对于视觉的理解,和第三方理解并文字化后输入,理解程度是指数级别的差距,但是不太懂这块,所以不敢下结论。

    我的体感上确实多模态模型对于图片的认知会更好。比如我用 qwen3.8-27B 去给 H3 理解图片素材并喂提示词,效果远强于纯文本模型。
    sentinelK
        11
    sentinelK  
       Aug 21
    @yagamil 可以参照我的经验帖: https://www.v2ex.com/t/1235518
    wjxd
        12
    wjxd  
       Aug 21
    @ashong 我的是 7900xt ,昨天也试了这个 qwen3.8 ud q4 k m 的版本,你是用什么加载模型?是 window 环境还是 linux 环境啊?
    wjxd
        13
    wjxd  
       Aug 21
    @ashong 忽略。我没仔细看帖子最后。。。
    Seanfuck
        14
    Seanfuck  
       Aug 21
    最后一个好。Qwen 明显比 Deepseek 强。
    honjow
        15
    honjow  
       Aug 21
    同 7900xtx 。op 感觉用哪个量化最均衡啊
    coefu
        16
    coefu  
       Aug 21
    鹈鹕很 Q 。
    xuhengjs
        17
    xuhengjs  
       Aug 21
    要不,用 deepseek 最新的 flash-vision-exp 试试?
    ashong
        18
    ashong  
    OP
       Aug 21
    @honjow Q5_K_M
    jhytxy
        19
    jhytxy  
       Aug 21
    建议量化模型至少还是用到 q6

    q5 离原版差的比较远
    honjow
        20
    honjow  
       Aug 21
    @ashong #18 上下文能开多少啊。我试了很多次都达不到 77tps 这个速度
    ByteZone
        21
    ByteZone  
       Aug 21
    48GB 的 mac mini 跑 QWen 3.6 27B 做 rag 慢的要是
    硅基流动一到两分钟 本地 ollama 要 10 到 60 分钟不等
    大佬知道问题出在哪里了吗
    ashong
        22
    ashong  
    OP
       Aug 21
    @honjow

    启动参数供参考:

    -t 10
    -b 512
    -ub 256
    --spec-draft-n-max 3
    --fit off
    --no-context-shift
    --metrics
    --kv-unified
    --jinja
    --cache-type-k q8_0
    --cache-type-v q8_0
    -fa on
    --spec-type draft-mtp
    --ctx-size 131072
    --parallel 1
    -ngl -1
    --chat-template-kwargs {"enable_thinking": true, "preserve_think": false, "reasoning_effort": "medium"}
    --no-mmap
    --temp 0.6
    --top-p 0.6
    --top-k 15
    --repeat-penalty 1
    --repeat-last-n 64
    --override-tensor blk\.\d+\.ffn_.*_exps\.=CPU
    --image-min-tokens 1024
    --no-warmup -
    -cache-ram 16384
    --alias qwen3.8-27b-q5km
    PopRain
        23
    PopRain  
       Aug 21
    这个测试太多了,应该换个鸟,譬如鸵鸟再看看效果
    pldxx
        24
    pldxx  
       Aug 21
    收藏一下
    C64NRD
        25
    C64NRD  
       Aug 21
    这个理解能力可以胜任很多 web 工作,就是耗时太久了
    SiWXie
        26
    SiWXie  
       Aug 21 via iPhone
    上下文大概能到多少呢?
    L4Linux
        27
    L4Linux  
       Aug 21 via Android
    niubee1
        28
    niubee1  
       Aug 22
    感觉可以用 GLM5.3 来驱动 qwen3.8 27B ,干起活来能杠杠的
    Maboroshii
        29
    Maboroshii  
       Aug 22
    我看 qwen-3.8 27B 在 openrouter 上比 deepseek-v4-flash 还要贵不少呢
    killadm
        30
    killadm  
       Aug 22
    你的 q5 和原版 fp8 生成的差不多,但是用破限版的 int8 模型测试生成的动画反而车轱辘乱飞
    ayyll
        31
    ayyll  
       Aug 22
    楼主你部署的这套设备多少钱?有超过 1w 吗
    ashong
        32
    ashong  
    OP
       Aug 22
    @ayyll 5 月买的,TUF B550 + cpu 5600 + 32G ddr4 , 全套不到 8k
    sentinelK
        33
    sentinelK  
       Aug 22 via iPhone
    @killadm 说明微调的时候只顾去拒绝率了,其他的对齐能力没管
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5668 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 84ms · UTC 01:52 · PVG 09:52 · LAX 18:52 · JFK 21:52
    ♥ Do have faith in what you're doing.