• 请不要在回答技术问题时复制粘贴 AI 生成的内容
rizon
V2EX  ›  程序员

这里为什么感觉没人讨论国产模型。我发现 qwen 和豆包系列模型问题好多,生产直接没法用

  •  
  •   rizon ·
    othorizon · 5h 20m ago · 1731 views
    对话类产品。
    生产环境过去一直在用豆包,但是豆包 ttft 越来越大已经没法用了,所以想换 qwen 。
    而且豆包还有概率出现脱靶问题和工具调用幻觉问题

    结果 qwen3.7 plus 输出总是半截就中断,概率非常大没法用。
    换成 3.8 max ,先是专属 endpoint 输出内容缺少 role ,这事我就排查了很久。
    然后换成 dashscope 域继续用想着没事了,结果发现模型带图时输出质量严重下滑,区分不出注释内容和对话内容的角色概念。

    搞得我现在一个没得用。做角色扮演对话还有什么好的选择吗
    Supplement 1  ·  1h 34m ago
    最新进展。刚才实测终于排查出来。
    qwen3.7 plus 在有 tools 的情况下存在输出被截断的 bug 。
    Supplement 2  ·  1h 32m ago
    看回复大家都是 AIcoding 的场景,不是 AI 产品的开发。所以确实不在乎这些。但是做国内 AI 产品只能选这些国产模型。
    感觉 AI 时代即使大厂出品的品控也在下滑
    30 replies    2026-09-09 17:45:00 +08:00
    rizon
        1
    rizon  
    OP
       5h 16m ago
    好吧,这会排查到原因了 。
    thinking:{type:disabled} 关闭思维链会导致思维链进入正文。
    hhsd
        2
    hhsd  
       4h 0m ago
    能上 v2 的 谁手上还没有个 gpt 了 再不济也有中转 图豆包会流口水么
    catinsides
        3
    catinsides  
       3h 56m ago   ❤️ 2
    部分国产模型向来是跑分没输过,体验没赢过,一用一个不吱声。以前好歹便宜量大,现在定价比国外的还贵,几个问题就用完 5 小时额度,让我再买是不可能了。
    lmmlwen
        4
    lmmlwen  
       3h 46m ago   ❤️ 1
    羊粪蛋子表面光,比如城市下水道,比如甲醛大白菜,比如 ChinaGT 也与老大爷救援人员
    7gugu
        5
    7gugu  
       3h 39m ago
    国产模型推荐 GLM 5.3 ,比肩 5.6 terra ,ttft 也更快
    yyttrr
        6
    yyttrr  
       3h 35m ago
    一直用 deepseek,平时 flash,负责紧急问题开一下 pro,也够用了,而且响应速度很快.最大的方便是每个月报销的时候直接能开发票,财务报销流程效率很多,其他同事用 claude 或者 gpt 的没发票流程复杂一些
    justxwy
        7
    justxwy  
       2h 9m ago
    qwen 3.8 max 我和我同事都非常好评啊,写代码很厉害。
    kimhooo
        8
    kimhooo  
       2h 5m ago
    “生产直接没法用”——谜底就在谜面上
    ebushicao
        9
    ebushicao  
       1h 59m ago
    国产模型只需要看 glm 、kimi 、deepseek ,图像和视频方面倒是可以看豆包。
    FreshOldMan
        10
    FreshOldMan  
       1h 58m ago
    能用最好的,肯定不用排第二的啊
    wat4me
        11
    wat4me  
       1h 44m ago
    国产只看 glm kimi DeepSeek ,qwen 的优势是小模型厉害,可以在特定领域微调
    mechunjun
        12
    mechunjun  
       1h 43m ago
    因为不在意,因为不在乎
    mechunjun
        13
    mechunjun  
       1h 43m ago
    来自 claude max 20x 和 chatgpt pro 20x 双持用户
    wang9571
        14
    wang9571  
       1h 40m ago
    喜欢什么用什么呗,有什么好讨论的
    jacketma
        15
    jacketma  
       1h 39m ago
    一言难尽吧,算力和算法都有差距,主要还是有参照物,如果没有海外模型的能力对比,国模也挺好的
    rizon
        16
    rizon  
    OP
       1h 35m ago
    @justxwy 常规使用没问题,但是在一些细节上 bug 挺多。也不知道为什么,是上线前测试 case 没覆盖吗。感觉 AI 时代各种大厂产品的可靠性都在下降。

    比如已经和 售后确认过的 qwen3.8max 的 maas endpoint 确实有某些情况下输出缺失 role 字段的 bug 。
    maocat
        17
    maocat  
       1h 25m ago
    使用的问题,openai 这些模型是不吐思考内容的,所以用他们的框架没问题,模型在进步,框架也在变,虽然明着说支持 openai sdk 格式,qwen ,ds 或多或少都有些问题,比如 ds 要求执行 tool 带上思考内容,或者每次执行都会先吐一段思考内容,再执行工具,这些 case
    latifrons
        18
    latifrons  
       1h 15m ago
    因为没法用,所以没人讨论
    rizon
        19
    rizon  
    OP
       1h 7m ago
    @maocat 是这样的,国内想找一个真的能用的模型其实选择范围非常小。看着百花齐放,但是线上产品想要换个模型的时候真能换的基本没有。

    而且因为参数兼容和模型内部的一些各自特性换模型时还很容易出事故。

    为此我专门做了一模型 api 兼容性测试网站: https://llmapicheck.dev/
    maocat
        20
    maocat  
       44 mins ago
    @rizon #19 你这个工具。。。我得打击你一下,有很多服务商不允许跨域调用的
    dryadent
        21
    dryadent  
       43 mins ago
    因为我没在生产环境用啊,gpt 6 都一堆问题,更何况这些蒸馏的
    crackself
        22
    crackself  
       41 mins ago via Android
    v 友要生产力的,逗乐子看郭德纲于谦比国模更具性价比
    rizon
        23
    rizon  
    OP
       36 mins ago   ❤️ 1
    @maocat 哈,是有这个问题,所以按说还得加自定义代理功能。另外我后面打算支持在服务器终端上跑,这样延迟测试也更准一些
    rizon
        24
    rizon  
    OP
       34 mins ago
    @dryadent
    @crackself 哎,没得选啊,实时对话产品延迟敏感, 还有成本问题。如果有好的低延迟、低成本的 gpt 模型选择就好了。
    pmer
        25
    pmer  
       31 mins ago
    要区分下具体模型,至少 seedance2.0/2.5 能打的,它是属于豆包系列模型(对外品牌名称)
    ReinXD
        26
    ReinXD  
       30 mins ago
    @rizon 那也应该选 deepseek 不是 qwen ,qwen infra 水平真得不敢恭维
    ovtfkw
        27
    ovtfkw  
       29 mins ago via iPhone
    k3 呢 直接不是说吊打 opus 吗 现在如何了
    f1ynnv2
        28
    f1ynnv2  
       14 mins ago
    豆包只在用语音识别
    alsas
        29
    alsas  
       9 mins ago
    因为默认不能用
    lovelive1024
        30
    lovelive1024  
       8 mins ago
    如果是角色扮演用 ds 啊,那些玩酒馆的人很多都是用 ds
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   4729 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 55ms · UTC 09:53 · PVG 17:53 · LAX 02:53 · JFK 05:53
    ♥ Do have faith in what you're doing.