BingoXuan

BingoXuan

V2EX member #170096, joined on 2016-04-22 13:23:09 +08:00
Today's activity rank 7473
Per BingoXuan's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
BingoXuan's recent replies
@sentinelK
sglang 推荐 nvfp4 量化是 RadixArk/Qwen3.8-27B-NVFP4 版本。unsloth 家的 nvfp4 量化可能还不如自家的 gguf 。NVIDIA 的 3.6 27B 的 nvfp4 量化明显比 unsloth 好得多。qwen3.8 的 kv cache 量化最多只能去到 fp8 ,到目前 nvfp4 的 kv cache 量化各家支持还是半残废。Blackwell 的硬件潜力还没有完全挖掘出来。
等 Qwen3.8 35BA3B 吧。3.8 27B 最大问题不是权重。而是 kv cache 。q8 量化跑满 262k 上下文要 8-9G 显存。开 turbo quant 有损失。即使是 Blackwell 显卡,vllm 和 sglang 都还没支持完整的 nvfp4 kv cache 支持
8 days ago
Replied to a topic by OBJECTION 健身 中登有多少在健身的...
一三五去游半个小时
12 days ago
Replied to a topic by netox 分享发现 在线体验 16K token/s 的新大模型部署架构
@cowcomic
deepseek 激活也是 13B 。这时候就是 xilinx 出马了,通过 pcie 重新烧录权重数据。那样 n 张互联就能跑 deepseek v4 flash 0731 了。主要问题是如何把权重数据变成可烧录。
@Hyschtaxjh
六面骰子一样不够随机。参考 cloudflare 办公室的随机数采样
我昨天一天就消耗了 65%了。现在 review 也是用自己部署的 27B 在干。感觉就是逼着人升级 Pro (因为不禁用,我有这个升级想法)
Jul 25
Replied to a topic by rpish 问与答 技术已死?
以前的技术是不同个体探索得到的知识和经验,现在探索都靠 AI 了,经验都被模型厂吸收了转换到模型中。所以技术更多是,和 AI 协作过程中,个体未知知识是否被消化。
Jul 21
Replied to a topic by Leon6868 程序员 多端 GUI 真的没有银弹吗
@Leon6868
skill+多模态+playwright 能加速回环。小模型可以用来验证流程和细节提供相关信息,大模型负责实现。
Jul 21
Replied to a topic by Leon6868 程序员 多端 GUI 真的没有银弹吗
@Leon6868
去年就用 webgl shader 实现了一个实时波形渲染,300 个信号,信号长度 2k ,120fps 点毫无压力。web 反馈回环非常快,AI 很擅长的。如果 AI 就是一个 compiler ,那么任何框架都不重要
R.I.P. 也许写信个 tim cook 更有效,但前提是怎么这台手机是你妻子购入或者所有的
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3054 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 11ms · UTC 12:14 · PVG 20:14 · LAX 05:14 · JFK 08:14
♥ Do have faith in what you're doing.