点此纠错
雨晴LLM手机版是一款在安卓手机上离线运行大语言模型的服务器工具,它让你不用联网也不用花钱租服务器,就能在手机里跑AI对话和文本生成功能,安装后不需要复杂的编译配置,启动服务后,任何支持OpenAI接口的聊天客户端都可以直接连上你手机里的模型,就像拥有一个随身携带的私人AI,喜欢的朋友欢迎前来下载体验。
雨晴LLM是一款运行于Android平台的本地离线 LLM推理服务器,软件配套完善实用功能,
支持 CPU与 GPU推理后端自由切换,搭载实时性能统计仪表板直观监控推理负载,
配备可拖动悬浮窗口方便随时调控服务,同时提供持久后台服务能力持续运行推理进程;
模型文件需要用户单独下载导入,灵活按需选择不同规格权重。

1、提供基础推理参数自定义选项,可调整温度、上下文长度、最大生成长度等配置,适配创意写作、逻辑推理、代码生成等不同任务需求。
2、优化移动端资源调度策略,后台推理时管控功耗与内存占用,减少长时间运行出现卡顿、闪退问题,延长离线推理任务持续运行时长。
3、支持多客户端同时接入本地API服务,局域网内其他设备也可访问推理接口,实现手机作为家庭离线AI中枢,供多终端调用大模型能力

1、支持 CPU、GPU两种推理后端自由切换,可根据手机硬件配置、功耗需求自主选择,兼顾老旧设备兼容性与高性能机型加速推理的使用场景。
2、内置 NanoHTTPd网络服务,在本机开放兼容 OpenAI规范的 API端点,各类聊天前端、自动化工具、脚本程序均可直接接入,轻松对接成熟的 AI软件生态。
3、配备实时统计仪表板,可视化展示推理速度、内存占用、负载状态等运行数据,方便用户监控模型运行状态,及时调整参数优化推理表现。

1、安装APK,授予存储、后台悬浮窗、后台运行权限;
2、进入模型管理页面,下载对应Gemma量化模型文件;
3、选择CPU/GPU推理后端,启动本地API服务;
4、使用任意兼容OpenAIAPI的客户端,填写本地地址`//127.0.0.1:8080`即可调用;
5、悬浮窗可随时查看生成进度、切换模型、关闭服务。
支持持久后台服务模式,启动推理服务后可切至后台持续运行,不会因页面退出中断推理任务,稳定为外部客户端持续提供AI接口服务。
模型采用独立下载机制,用户按需获取对应量化规格的Gemma权重文件导入,不强制捆绑内置模型,灵活平衡存储空间与推理效果。
完整兼容标准OpenAI对话接口格式,支持多轮对话上下文、参数自定义,几乎无需修改代码,即可将原有云端AI程序迁移至手机本地离线运行。
提供可拖动悬浮窗口,无需常驻应用主界面,在任意界面快速启停服务、切换模型、查看运行日志,多任务并行操作更加便捷高效。
39M
1675.71M
2782.39M
3218.79M
490.39M
563.42M
6606.67M
7281.97M
895.77M
9151.76M
10