在 Android/Termux 上使用 Adreno 840 + Vulkan 部署 llama.cpp 本地大模型
随着移动端 SoC 性能越来越强,现在已经可以直接在 Android 手机上运行 GGUF 格式的大语言模型。本文记录一次实际部署过程:使用 Termux + llama.cpp + Mesa Freedreno/Turnip + Vulkan,让高通 Adreno GPU 参与 LLM 推理。 本文以 Adreno 840 为例,并使用 LFM2.5-2.6B-Q8_0 进行测试。 一、环境 本次测试环境: 项目 配置 系统 Android SoC Qualcomm Snapdragon GPU Adreno 840 推理框架 llama.cpp llama.cpp b10516 GPU Backend Vulkan Mesa 26.0.6 Vulkan 驱动 Freedreno / Turnip 模型 LFM2.5-2.6B-Q8_0 模型大小 约 2.7 GB 手机使用的是统一内存架构,因此 vulkaninfo 显示的 GPU memory 并不是传统 PC 独立显卡意义上的 VRAM。 二、安装 Termux 建议使用官方 Termux 项目提供的版本,不建议使用来源不明的第三方修改版。 ...