dbow
V2EX  ›  Local LLM

两台 dgx-spark 部署满血 deepseek v4 flash 完全指南,稳定 60~70tok/s 单流

  •  
  •   dbow · 1 day ago · 3977 views
    前天看 x 上有人做成这事, 觉得很不错, 下单买了两台, 6 万 8, nvidia 原厂 dgx spark 带并连线
    实测两台刚好能拿捏 deepseek v4 flash 0731 ,vibe coding 单流 60–70 tok/s 的体验足以覆盖日常 ;不是“能跑起来”的演示水平,而是可以当主力开发机稳定干活。
    主要是为了本地化隐私部署, 经常会跟 ai 聊很多机密信息, 不放心, 靠硬件出 token 得好几年才能回本.
    欢迎交流
    github: https://github.com/maliubiao/dgx-spark-2-deepseek-flash-0731
    43 replies    2026-08-08 12:24:33 +08:00
    yoshiyuki
        1
    yoshiyuki  
       1 day ago
    但是你的 agent 说到底是联网的, 信息潜在的泄漏点太多了
    Lazymio
        2
    Lazymio  
       1 day ago
    6 万 8 是京东自营的?感觉买贵了。
    SayHelloHi
        3
    SayHelloHi  
       1 day ago
    @dbow

    老铁咨询下,DXG 使用 comfyui 体验如何?

    也想入手
    wyntalgeer
        4
    wyntalgeer  
       1 day ago
    感谢,已 star
    dbow
        5
    dbow  
    OP
       1 day ago
    @SayHelloHi 跑一个 deepseek v4 flash 90%计算资源就用光了, 暂时还没试过别的东西.
    Insolitude
        6
    Insolitude  
       1 day ago via Android
    可以帮忙用 llama-benchy ( https://github.com/eugr/llama-benchy )测一下吗?之前用两台 spark 测过预览版的 deepseekv4 flash ,当时跑起来还蛮吃力的,想看看现在性能怎么样


    """
    | model | test | t/s (total) | t/s (req) | peak t/s | peak t/s (req) | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
    |:------------------------------|------------:|----------------:|----------------:|-------------:|-----------------:|------------------:|------------------:|------------------:|
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c1) | 955.27 ± 193.11 | 955.27 ± 193.11 | | | 2257.64 ± 530.54 | 2251.15 ± 530.54 | 2257.64 ± 530.54 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c1) | 38.67 ± 1.58 | 38.67 ± 1.58 | 39.93 ± 1.63 | 39.93 ± 1.63 | | | |
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c2) | 919.38 ± 159.59 | 586.78 ± 244.14 | | | 3948.41 ± 1160.98 | 3941.91 ± 1160.98 | 3948.41 ± 1160.98 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c2) | 39.08 ± 20.50 | 25.04 ± 9.26 | 58.67 ± 3.09 | 29.79 ± 3.35 | | | |
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c4) | 924.07 ± 122.40 | 358.73 ± 142.02 | | | 6692.54 ± 2550.41 | 6686.05 ± 2550.41 | 6692.54 ± 2550.41 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c4) | 18.68 ± 2.40 | 10.41 ± 5.84 | 71.33 ± 4.03 | 19.42 ± 1.32 | | | |

    llama-benchy (0.3.7)
    date: 2026-05-18 16:43:49 | latency mode: api
    """
    mouyase
        7
    mouyase  
       1 day ago
    《不是“能跑起来”的演示水平,而是可以当主力开发机稳定干活。》

    您也 AI 化了。
    dbow
        8
    dbow  
    OP
       1 day ago
    @mouyase ai 写的文档, 我复制了一句过来, 哈哈
    Nasdaq
        9
    Nasdaq  
       1 day ago
    请教老哥,功耗/发热怎么样?我也想搞 2 台玩玩。
    defunct9
        10
    defunct9  
       1 day ago
    新模型发布这么快,花 6 万 8 ,合适么?
    Tink
        11
    Tink  
       1 day ago
    好像还不错啊
    ferch
        12
    ferch  
       1 day ago
    这很好呀,能自己本地玩了
    dbow
        13
    dbow  
    OP
       1 day ago   ❤️ 1
    @Nasdaq agent 跑起来 gpu 70 度左右
    asdjgfr
        14
    asdjgfr  
       1 day ago
    省着点用,10 年之后我要捡垃圾自己部署一个😆
    Nasdaq
        15
    Nasdaq  
       1 day ago
    @dbow #12 继续请教您,部署起来困难吗?还是说能让 cc/cx 直接托管一键部署?
    lizhenda
        16
    lizhenda  
       1 day ago
    等新模型发布了,硬件不够用了怎么办?
    ysz1121
        17
    ysz1121  
       1 day ago
    6.8w 充 deepseek 官方,是不是能用一年?
    shyrock2026
        18
    shyrock2026  
       1 day ago
    op 这个速度是开的 200k 上下文还是 1m 呢?
    dbow
        19
    dbow  
    OP
       1 day ago   ❤️ 1
    @Nasdaq 全交给 ai
    dbow
        20
    dbow  
    OP
       1 day ago   ❤️ 1
    Newb1e
        21
    Newb1e  
       1 day ago
    心动
    faker5276
        22
    faker5276  
       1 day ago
    deepseek 涨价以后,这方案就有性价比了
    op351
        23
    op351  
       1 day ago
    @ysz1121 按现在 ds 的 api 定价,一天 24 小时不停的用,保守点能用 10 年
    不过现阶段算力本地部署基本不是为了省钱,而是为了合规和数据隐私
    dbow
        24
    dbow  
    OP
       1 day ago   ❤️ 1
    @op351 大概三年能回本, 目前一个月 1k 的 v4 flash api 费用,假定涨价后价格翻倍, 则一年需要 2.4w 的 token 费用, 算上电费之后三年回本.
    yanhuqing666
        25
    yanhuqing666  
       1 day ago
    有点意思
    AEDaydreamer
        26
    AEDaydreamer  
       1 day ago
    没钱没需求, 但是看完有很心动的感觉.
    lhtdeg
        27
    lhtdeg  
       1 day ago
    速度这么快?那我也要搞一个了
    Lighfer
        28
    Lighfer  
       1 day ago via Android
    老哥,有试过能支撑多少并发和速度不?
    Lighfer
        29
    Lighfer  
       1 day ago via Android
    @Lighfer 看到了链接里有
    ziyeziye
        30
    ziyeziye  
       1 day ago
    看看 B 站有搭配教程
    [全网首发] 11999-31999 元,22t/s 本地部署 deepseek-v4 v4pro ,支持 agent 、codex ,本地知识库,无需使用 Linux
    [全网首发] 11999-31999 元,22t/s 本地部署 deepseek-v4 v4pro ,支持 agent 、codex ,本地知识库,无需使用 Linux
    [全网首发] 4799 部署 wukomg4.1 ,本地 agent 万能小模型,单机 8 并发支持 claw 与知识库,无需使用 Linux !
    [全网首发] 4799 部署 wukomg4.1 ,本地 agent 万能小模型,单机 8 并发支持 claw 与知识库,无需使用 Linux !
    [全网首发] 11999 元,11t/s 本地部署 glm5.2 ,支持 claw 与 agent 知识库,win11 操作无需使用 Linux !
    [全网首发] 11999 元,11t/s 本地部署 glm5.2 ,支持 claw 与 agent 知识库,win11 操作无需使用 Linux !
    [全网首发] 2899 元 30t/s ,4.8 升体积 qwen3.6-27b 本地部署,Windows 下支持 agent ,龙虾,5999 元可跑原版非量化,无需 linux 操作
    [全网首发] 2899 元 30t/s ,4.8 升体积 qwen3.6-27b 本地部署,Windows
    Nasdaq
        31
    Nasdaq  
       1 day ago
    @ziyeziye 我是 4090 ,部署过 qwen3.6-27B ,速度可以。但是蠢哭了~
    ziyeziye
        32
    ziyeziye  
       1 day ago
    @ziyeziye 都是满血版的
    seers
        33
    seers  
       1 day ago via iPhone
    模型也在进化,相同硬件也可以免费获取性能升级
    wsbqdyhm
        34
    wsbqdyhm  
       1 day ago
    @Nasdaq #31 20-30 的速度,经常任务中断
    Nasdaq
        35
    Nasdaq  
       1 day ago
    @wsbqdyhm 那还没有深入测,跑了个 30 分钟感觉不行就丢了。
    Yserver
        36
    Yserver  
       1 day ago
    感觉有点慢 ds 新的那个加速是不是没生效啊?
    dbow
        37
    dbow  
    OP
       23h 41m ago
    @Yserver 已经开启了 dspark 才有 60~70tok/s
    sillydaddy
        38
    sillydaddy  
       21h 54m ago
    这么估算回本时间呢:
    1. Deepseek ,1 次调用平均输出 420 token ,按官方 API 计价花费¥0.004 元。那么¥68000 元可以纯输出 7,140,000,000 个 token 。

    2. 现在驱使 DGX-Spark ,每秒输出 60 token 。

    回本需要 3.7 年=7,140,000,000÷60÷3,600÷24÷365 。(电费是零头)
    dbow
        39
    dbow  
    OP
       21h 49m ago
    @sillydaddy 这只算了输出, 实际并发能做到 200tok/s, 输入能做到 1000 tok/s,输入也是收费的
    fanhed
        40
    fanhed  
       16h 15m ago
    @yoshiyuki agent 是否联网是可控的
    fanhed
        41
    fanhed  
       16h 12m ago
    @sillydaddy 还要算 prefill, 还要算 prefill 的 cache 命中
    bigdogbigpig
        42
    bigdogbigpig  
    PRO
       8h 15m ago
    如果满血 ds v4 flash 可以用两台 dgx spark 部署,那还有别的模型可以部署吗?
    yoshiyuki
        43
    yoshiyuki  
       7h 23m ago
    @fanhed 现实中真正投入使用的 agent, 联网的多, 不联网的少
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2588 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 95ms · UTC 11:47 · PVG 19:47 · LAX 04:47 · JFK 07:47
    ♥ Do have faith in what you're doing.