iarch's recent timeline updates
iarch

iarch

V2EX member #18921, joined on 2012-03-31 12:26:47 +08:00
iarch's recent replies
@MHPSY 还是继续改进语料和模型,把输入准确率提高一些,框架和 UI 都是继续依赖 Fcitx5 或者 iBus 了

Android 也可以试试,后面会把手写识别集成进去。

@Redmoon 短期内应该不会做双拼,主要是我自己不怎么用
也请大家多多反馈 issue ,给些 star ,谢谢
更新:尝试了下蒸馏,改进了下延迟,推荐试用下 Android 版

https://github.com/Ismantic/SimeApp/releases/tag/v0.15.4
@firefox12 4080 的话,可以试试训练 165M 那个版本的,对显存要求会小一些,要完成预训练,是需要连续训练两天多。另外你说的计算 1-100 所有的质数的倒数之和的问题,这个模型是做不到的,只能做一些字分类任务。
@leon0318 跟 Qwen 完全是两个东西哈,那个是 Decoder ,这个 Encoder ,主要做一些字分类任务的
更新:把 AUR 流程完成了,ArchLinux 下可以通过 yay -S fcitx5-sime 安装了
@SayHelloHi http://github.com/Ismantic/IsCut 词库部分依赖这个中文分词库,可以看看这个
把驱动这个输入法的中文分词部分也顺带说一下,项目地址:github.com/Ismantic/IsCut 这个是专门配套前面的输入法项目的分词库。若是随便搭配一个分词去做语言模型统计的话,要控制词表大小的话,不可避免会引入很多 OOV ,这对输入法其实是不可接受的,输入法该能做到输入全部合法汉字。这个库就是解决这个问题的。
@dddedd 其实可以搞,引擎是统一的,用 Cc/Codex 实现个前端也不难。
其实这个项目很适合对中文输入法感兴趣的人学习,自认为这个项目包含了全部训练和推理的输入法实现细节。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1223 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 15ms · UTC 17:36 · PVG 01:36 · LAX 10:36 · JFK 13:36
♥ Do have faith in what you're doing.