AutumnVerse
V2EX  ›  问与答

大哥们,多模态大模型,能给个对比吗?

  •  
  •   AutumnVerse · 2 days ago · 1639 views
    让 ai 监控画面,然后自动执行处理,7*24 运行,哪家比较合适?另外不能太慢,那 chatgpt5.6 sol 跑了一天,效果挺不错的,但是太慢了,一次请求要 10s 左右,延长太高经常出问题。

    以前在 v 站看到一个模型对比表格,列出了各个模型的参数量、价格、跑分,但是现在搜不出来了,哪个大哥能再给一个吗
    26 replies    2026-09-08 07:51:02 +08:00
    clemente
        1
    clemente  
       2 days ago
    哥们 NASA 都不敢这么用
    AutumnVerse
        2
    AutumnVerse  
    OP
       2 days ago via iPhone
    @clemente ?有啥问题吗?成本太高?

    sol 跑了一天,几千块钱成本而已,也可能是 sol 太慢了,10 秒左右才返回一次。
    ruanimal
        3
    ruanimal  
       2 days ago
    一天几千块而已。。
    clemente
        4
    clemente  
       2 days ago
    @AutumnVerse 首先多模态的模型不是干监控的。99%的多模态就是 画面描述器的胶水模型 和 LLM 投影沾到一起的

    我不知道你实际的工作需求,如果能走 cli 还是尽可能走 cli 或者 headless
    wizChen
        5
    wizChen  
       2 days ago
    这种本地部署比较好吧
    Nasdaq
        6
    Nasdaq  
       2 days ago
    这,OP 拿一张监控画面跑一下看看成本,要是 24 小时非常夸张的。。。
    AutumnVerse
        7
    AutumnVerse  
    OP
       2 days ago via iPhone
    就是拿来跑监控的,把图片压缩到 480p ,token 消耗还行,唯一问题是 sol 太慢了,处理一帧要 10s ,取下一帧的时候已经过了 10 多秒了,这期间如果出现异常又消失了,ai 就监控不到了。

    成本那是老板考虑的,我知道 yolo ,也知道传统的 opencv 里面的算法,但是你用那些算法做出来,老板怎么给投资人吹牛逼,你连大模型都没用上,谁给你投资。
    @Nasdaq
    @ruanimal
    AutumnVerse
        8
    AutumnVerse  
    OP
       2 days ago
    @clemente 现在是写了一个程序,把相关画面抽帧给 ai ,让 ai 发现某些事件,调用对应的 function 处理。

    主要问题是 sol 太慢了,导致抽帧非常少,两帧中间的内容就丢掉了。尝试了 gemini flash 3.8 ,看统计也要 4s 左右一次,也没快多少。
    Nasdaq
        9
    Nasdaq  
       2 days ago
    @AutumnVerse #7 这是我一个类似项目用 gemini-3.7-flash 做图片理解(仅供参考),图片分辨率大概 1080p 左右

    Routing 197ms
    Google 2.6s
    Generation 8.5s
    Total 11.3s

    Cost $0.00632
    Throughput 179.0tok/s
    xujinkai
        10
    xujinkai  
       2 days ago via Android
    并发呗,真有钱🤣
    AutumnVerse
        11
    AutumnVerse  
    OP
       2 days ago via iPhone
    @Nasdaq 那跟我测试差不多,我用的 480p 会快一点。但是总耗时也要 4s 左右。
    tim9527
        12
    tim9527  
       2 days ago
    想想就好贵,家底富裕啊
    clemente
        13
    clemente  
       2 days ago
    @AutumnVerse 我 6 年前做过类似的,我做的是检测+跟踪。我的方法是帧不变走缓存,帧变了走识别那一套逻辑,但是有一点因为设备计算能力达不到实时,所以我加了异步队列和跳帧方法,这样能保证所有事件捕捉+某个场景能同步到实时
    cvooc
        14
    cvooc  
       2 days ago
    误闯天家系列, 没这么用过...
    wysnxzm
        15
    wysnxzm  
       2 days ago
    做异步,延迟 10s 而已不会漏数据
    winterx
        16
    winterx  
       2 days ago
    你需要的是视频算法而不是 AI ,当然 AI 也能干这事就是太烧钱了
    如果成本受限可以考虑海康、商汤或者旷视
    AutumnVerse
        17
    AutumnVerse  
    OP
       2 days ago via iPhone
    @cvooc
    @tim9527 做 cv 算法的工程师,一个月也得三四万,这一套下来,两三个人也得十来万了,这钱拿来买 token ,我觉得是帮公司省钱了。而且招人也要时间,开发也要时间,改 bug 也要时间。

    几天时间能跑通业务,完成商业验证,简直赚麻了。
    la9998372
        18
    la9998372  
       2 days ago
    你是啥场景啊?非要用大模型来做?
    现在的 qwen3.8flash 和 glm5.3flash 都支持多模态了,应该性价比和性能都挺不错吧
    cvooc
        19
    cvooc  
       2 days ago
    @AutumnVerse #17 哪怕让 ai 写算法呢...花点钱...上肥波,上 astra... 也比直接让 ai 识别强啊...
    gpt5
        20
    gpt5  
       2 days ago
    我知道几家公司的主营业务就是这个。
    上百个监控全接进来,实时 ai 分析。
    AutumnVerse
        21
    AutumnVerse  
    OP
       2 days ago via iPhone
    @gpt5 直接上大模型还是传统的 yolo 类的小模型?
    gpt5
        22
    gpt5  
       2 days ago
    @AutumnVerse 本地大模型+精巧的系统设计+极限优化
    Sezxy
        23
    Sezxy  
       2 days ago
    本地部署 Qwen3.8-27B 是不是好点
    cyningxu
        24
    cyningxu  
       2 days ago via Android
    看楼主的描述是不考虑成本的,那直接异步,每秒固定往里丢个图,只是 10 秒后出判定结果而已,但这样做就不会丢数据
    fuyang3213
        25
    fuyang3213  
       1 day ago
    你要快,肯定是 gemini 的 flash 了,贼快。
    wm5d8b
        26
    wm5d8b  
       1 day ago via Android
    不如让 sol 帮你测试对比
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3155 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 47ms · UTC 12:28 · PVG 20:28 · LAX 05:28 · JFK 08:28
    ♥ Do have faith in what you're doing.