上周把一台忙置把年www.55abg55.net的骁龙865安卓机翻出来,用llama.cpp跑7B的Q4模子。离线问答能跑,首token年夜要1.8秒的。之后每秒5个token。

那个成绩不算锦绣,足够证明AI 驱动端侧 AI 不夜模是实验室玩具。实正卡住速度的,是内存带宽和散热,不是CPU主频。选模子别贪年夜的。手机端先看量化格局,塞进手机实操GGUF的Q4_K_M体积约3.8GB,8GB内存机械能加载,后台别开微疑。导出时把上下文压到2048。再年夜就容易被系统杀过程。小我习惯用MNN做推理引擎了,高通和联发科都有NPU后端,不中算子兼容性得逐个试驱动。AI 驱动端侧 AI 的省事正在于碎片化,统一份模子正在小米和三星上暗示可能差一倍的。

实操轨范很间接。拆Android NDK,交叉编译llama.cpp的arm64版本。把可施止文件和模子推到/data/local/tmp端侧的。

跑号令,./llama-cli -m q4.gguf -p '你好' -n 128 -t 4。线程数别逾越年夜核数量,用taskset绑到4个机能核的,若是报内存不敷,把-n改小,或者加--mlock锁住权重落地。我试过连绝对话20轮了,第15轮起头较着变慢。一看是热降频。端侧AI的功耗比精度更值得盯。拿红中测温枪打手机后背。

10分钟推理后44度,帧率5token/s掉还有2.3。处理方法就是设念短会话,语音叫醉用0.5B小模子的,复纯总结再走云端。

AI 驱动端侧 AI 的交互逻辑该当反过来,先假设离线,再决议可否联网了。何等隐私和提早都更可控。念复现,拿树莓派5加8GB内存,跑Phi-3-mini 4bit,接摄像头做当地识物问答。不要逃求SOTA,先让pipeline跑通。换模子、调线程、量温度。每一步都有回响反映了。端侧AI的乐趣就正在那,你能摸到每一毫秒提早。也能闻到主板发热的味道。