返回列表 发布新帖

[用户教程] 绿联系统本地部署一个轻量化模型使用GPU加速并接入Hermes&微信ClawBot

616 2
发表于 2026-7-1 12:37:58 | 查看全部 阅读模式 IP:–广东–广州

马上注册,结交更多好友,享用更多功能,让你轻松玩转社区。

您需要 登录 才可以下载或查看,没有账号?立即注册

×
绿联自带的AI插件比较旧不支持高级模型,本文教你怎么用llama-cpp容器开启CPU核显加速,并接入Hermes&微信ClawBot打造你基于本地私有的个人助手。

实现效果
启用 GPU 加速后,推理过程不再占用 CPU,核显资源被充分利用(满载运行)
9f31a32988b523f24a72294809feb6cd.png
7811a11ef10ee267c1dbdeb04973469c.png
ae70831ca607f29b996d57e83e7ff4e6.png

接入微信,实现实时对话交互。
image.png


部署LLAMA-CPP

1、前往 Hugging Face 下载合适的 GGUF 模型。请根据自身设备性能量力选择。本文演示设备为 DXP6800PRO,选用的是 Qwen3.5-2B-GGUF 模型。此外也有 4B、6B 等更大尺寸的模型可选,但推理速度会相应下降,2B 版本已能满足日常使用。
image.png
2、将下载好的模型上传至 NAS 的指定目录,本文示例路径为:/volume1/SystemData/Docker/data/llama.cpp
image.png
3、打开绿联容器应用,新建一个项目,项目目录自定义自己的
image.png
4、复制以下模板内容,需修改其中的 IP、用户 ID、API Key 等参数:
  1. name: llama
  2. networks:
  3.   loop_llama:
  4.     name: loop_llama
  5.     driver: bridge
  6.     ipam:
  7.       driver: default
  8.       config:
  9.         - gateway: 10.170.30.254
  10.           subnet: 10.170.30.0/24
  11.     driver_opts:
  12.       com.docker.network.bridge.name: loop_llama
  13. services:
  14.   llama-cpp:
  15.     image: ghcr.io/ggml-org/llama.cpp:server-vulkan
  16.     container_name: llama-cpp
  17.     restart: always
  18.     user: "1000:10"   #填上面示例显示的用户ID及用户组ID
  19.     group_add:
  20.       - "105"
  21.     cpu_shares: 1024
  22.     shm_size: 4G
  23.     networks:
  24.       loop_llama:
  25.         ipv4_address: 10.170.30.10
  26.     ports:
  27.       - 192.168.10.20:11434:8080  #要将IP更改为NAS地址
  28.     healthcheck:
  29.       test: ["CMD-SHELL", "curl -s -o /dev/null --head --fail http://localhost:8080/health || exit 1"]
  30.       interval: 60s
  31.       timeout: 3s
  32.       start_period: 6s
  33.       retries: 5
  34.     environment:
  35.       - TZ=Asia/Shanghai
  36.       - LLAMA_LOG_VERBOSITY=2
  37.       - LLAMA_ARG_HOST=0.0.0.0
  38.       - LLAMA_ARG_PORT=8080
  39.       - LLAMA_API_KEY=123456789       #更改好API_KEY
  40.       - LLAMA_ARG_MODELS_DIR=/models
  41.       - LLAMA_ARG_MODELS_MAX=2        #同时加载的最大模型数,占用内存量力而行
  42.       #- LLAMA_ARG_MODEL=/models/Qwen3.5-2B-Q4_K_M.gguf #只使用一个模型
  43.     devices:
  44.       - /dev/dri
  45.     volumes:
  46.       - /volume1/SystemData/Docker/data/llama.cpp:/models
复制代码

成功部署后访问设置的192.168.10.20:11434即可访问到对话页面(需要设置API才能对话)
image.png
设置完API后可以在聊天框测试一下模型。

Hermes Agent接入本地大模型及微信

1、在应用中心完成 Hermes Agent 的安装后,打开容器应用,在项目列表中找到 Hermes 容器。
image.png

2、执行以下命令进入配置流程
根据提示依次输入:
  1. hermes model
复制代码
image.png
API base URL [eAPI key [optional]:.g. https://api.example.com/v1]:输入上面配置的IP e:http://10.170.30.10:8080/v1
API key [optional]:输入上面配置的KEY e:123456789

3、接入微信官方有教程,这里不重复造轮子
https://www.ugnas.com/play-detail/id-129.html

配置Hermes Agent搜索
1、打开配置中心,配置搜索密钥,这几个都是可以免费注册的
image.png

完成上述所有步骤后,通过微信ClawBot进行对话,推理过程CPU不带动的。

评论2

mdIFgZLv.1 发表于 2026-7-2 08:45:24 | 查看全部 IP:–北京–北京 /数据上网公共出口
使用效果怎么样?响应速度如何?
夏夏子Lv.7绿联NAS社区会员用户 发表于 2026-7-2 09:23:36 | 查看全部 IP:–湖南–邵阳
自己部署的就怕响应速度慢 有没有测过这个的速度?

评论

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Copyright © 2026 绿联NAS私有云社区 版权所有 All Rights Reserved. 粤公网安备44030002002555号| 粤ICP备12028978号
关灯 在本版发帖
联系技术支持
返回顶部
快速回复 返回顶部 返回列表