wwhc's recent timeline updates
wwhc

wwhc

V2EX member #145809, joined on 2015-11-05 06:54:06 +08:00
Today's activity rank 8700
wwhc's recent replies
@clemente 请看我的上条回复
基本上主流开源 agent 都适配 llama.cpp 了。pi+llama.cpp 很好用
单卡 24GB GPU + llama.cpp + Qwen3.8-27B-UD-Q4_K_XL.gguf 可以上到 100K 的上下文,推理质量优于同 4 位量化的 vLLM 配置
建议 Linux + 32GB VRAM GPU + Qwen3.8-27B-UD-Q5_K_XL.gguf + llama.cpp ,可以上到 200k 的上下文。不建议用 vllm ,只能上到 4 位量化,推理质量显著劣于 llama.cpp 的 Q5 量化
2 days ago
Replied to a topic by 1258 程序员 qwen3.8 27B 被低估了
在我这测试 Qwen3.8 27B 智商比 DeepSeek v4 flash 0731 高,DeepSeek v4 flash 0731 的智力水平在 Qwen3.8 27B 和 Qwen3.6 27B/35B 之间
6 days ago
Replied to a topic by majuzhang Local LLM 公司本地部署开源模型
1 到 2 张 RTX 6000 + Qwen3.6/3.8 27B + llama.cpp 应该够你们公司用了,不建议用 vLLM ,推理速度可能快些,但输出质量不如 llama.cpp
@clemente 我建议你实际部署以体验真实的情况
@clemente DeppSeek 开源的是 167GB 的版本,仓库里标明了大小
DeepSeek-V4-Flash-0731
167 GB
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/tree/main
@clemente DeepSeek 开源的是 4B 版本,也就 167GB 左右,你可到 huggingface 计算具体大小
两块 RTX PRO 6000 ,配置 llama.cpp 用于提供推理服务,满血 v4 flash 也就 160GB 左右。就算是单 RTX 5090 ,也够个人用,输出也可以达到 10-20t/s
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5514 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 22ms · UTC 08:16 · PVG 16:16 · LAX 01:16 · JFK 04:16
♥ Do have faith in what you're doing.