跳到主要内容

配置 LLM 后端

NeoMind 的 AI Agent 与 AI Chat 依赖 LLM 后端理解自然语言并执行指令。本文介绍如何通过 Web UICLI 配置本地或云端 LLM。

后端总览

NeoMind 支持 10+ 种 LLM 后端,按部署形态分两类:

类别后端默认模型备注
本地(零配置)内置 llama.cpp平台精选(Qwen 3.5 / Gemma 4 / Ling-3.0-tiny / LFM2.5 等)Docker 镜像自带运行时,向导内一键下载,见下节
本地Ollamaqwen3.5:4b完全离线
本地llama.cpp(自托管)启动时加载自行运行 llama-server
云端OpenAIgpt-4.1-mini需 API Key
云端Anthropicclaude-sonnet-4-5需 API Key
云端Googlegemini-2.5-flash需 API Key
云端xAIgrok-3-mini需 API Key
云端Qwen(阿里)qwen-plus需 DashScope Key
云端DeepSeekdeepseek-chat需 API Key
云端GLM(智谱)glm-4.5-flash需 API Key
云端MiniMaxMiniMax-M2需 API Key
云端自定义网关任意OpenAI 兼容端点(类型选 OpenAI,填自定义 endpoint)

推荐:本地首选内置模型 MiniCPM5-2B(Q4_K_M,1.5GB,最低 3GB 内存,按默认 8K 窗口服务——2026-09 修正版评测工具命中率 81%,与云端 deepseek-v4-flash 同档;Apache-2.0 可分发)。内存充裕(4GB+)且需要最强 agent 时选 Qwen3.5-4B(须配 16K 窗口,8K 下会大幅退化)。Ollama 路线用 qwen3.5:4b

内置本地模型(零配置)

从 0.9.16 起,Docker 镜像内置 llama.cpp 运行时并预置官方精选模型;首次启动向导的 LLM 后端 步骤(或 设置 → LLM 后端 的内置模型卡片)可以直接下载使用:

  • 一键下载 — 模型列表来自远程模型目录(camthink-ai/NeoMind-Runtimesmodels/catalog.json,可持续上新、无需升级平台);离线时自动回退到内置精选列表
  • 按硬件自动推荐 — 下载页会标注每个模型的内存需求(如 MiniCPM5-2B 1.5GB、最低 3GB RAM;Ling-3.0-tiny 4.8GB、最低 6GB——注意 Ling 仅适合 8K 短会话)
  • 导入自己的 GGUF — 内置模型向导提供「导入本地模型」卡片:拖入 .gguf 文件(流式上传,不占内存)或填写服务器路径;平台自动解析名称/上下文/量化信息并以 SHA-256 校验落盘,导入模型与精选模型同等参与切换(上下文上限 128K)
  • 开箱即用 — 首次下载完成后自动注册为本地后端并按模型自带的最优采样参数(temperature / top-p / top-k)运行

方式一:Web UI 配置(推荐)

Step 1:安装 Ollama 并拉取模型(本地后端)

ollama.com 指引安装。安装后 Ollama 默认监听 http://localhost:11434

# 安装 Ollama(macOS / Linux)
curl -fsSL https://ollama.com/install.sh | sh

# 平衡之选(4B;建议配 16K 以上上下文)
ollama pull qwen3.5:4b

# 如需视觉能力(可读图),额外拉取视觉模型
ollama pull qwen3.5:4b-vl # 或 llava / minicpm-v 等

注意:请使用 qwen3.5:4b。文档历史版本提到的 ministral-3:3b / deepseek-r1:7b 已不再推荐——前者工具调用不稳定,后者体积过大且在边缘硬件上速度欠佳。

跳过此步如果使用云端后端(OpenAI / Anthropic / GLM 等)。

Step 2:进入 LLM 后端设置

打开 Settings(设置) → LLM Backends(LLM 后端)

LLM 后端列表 — 点击 Add Backend 添加

后端以卡片形式呈现(内置模型 / Ollama / llama.cpp / Cloud AI),点击对应卡片中的 添加实例(Add Instance) 进入配置表单。

Step 3:填写后端信息

Ollama(本地)

字段
类型Ollama
Endpointhttp://localhost:11434(默认;远程主机替换为对应 IP)
模型qwen3.5:4b(与 ollama pull 的名称一致)
Stream开启(推荐,流式输出体验更好)

云端(以 OpenAI 为例)

字段
类型OpenAI 兼容协议(或 Anthropic 协议)
API Key你的 API Key(如 sk-...
Base URL留空用官方;自建网关时填自定义端点
模型gpt-4.1-mini(或 gpt-4o / gpt-4-turbo 等)

国内厂商:Qwen / DeepSeek / GLM / MiniMax 均使用 OpenAI 兼容协议,NeoMind 内置各厂商的默认 endpoint,只需填 API Key 与模型名即可。

自定义网关(OpenAI 兼容端点)

如果你用的是 vLLM、Together AI、OpenRouter 等自建或第三方网关,在 Cloud AI 卡片中选择 OpenAI 兼容(OpenAI-compatible) 协议,填入:

  • base_url:网关地址(如 https://api.openrouter.ai/v1
  • api_key:网关 Key
  • model:网关暴露的模型名
LLM 后端配置表单

保存后 NeoMind 会探测后端能力(工具调用、多模态、上下文窗口),自动写入能力标签。

Step 4:设为默认并验证

AI Chat 顶部的模型选择器中选择该后端,即设为系统默认后端(当前默认后端带「活跃」标记),也可以用 CLI neomind llm activate <ID> 激活。

然后进入 AI Chat 发送一句问候验证:

AI Chat 验证 LLM 连接

如果 AI Chat 无响应,检查:

  • Ollama 是否在运行:ollama list 应能看到已拉取的模型
  • 云端后端:API Key 是否有效、网络是否通
  • 更多见 故障排查

方式二:CLI 配置

不想点界面?以下命令完成从创建到激活的全流程。

1. 查看现有后端

neomind llm list

2. 查看可用模型(Ollama)

# 列出 Ollama 已拉取的模型
neomind llm models

# 或指定远程 Ollama
neomind llm models --endpoint http://192.168.1.100:11434

3. 创建后端

# Ollama 本地
neomind llm create --name local --type ollama \
--endpoint http://localhost:11434 --model qwen3.5:4b

# OpenAI 云端
neomind llm create --name openai --type openai \
--endpoint https://api.openai.com/v1 \
--model gpt-4.1-mini --api-key sk-xxxx

# GLM 云端(OpenAI 兼容)
neomind llm create --name glm --type openai \
--endpoint https://open.bigmodel.cn/api/paas/v4 \
--model glm-4-flash --api-key xxx.xxx.xxx

# 自定义网关(OpenRouter 等,走 OpenAI 兼容协议)
neomind llm create --name router --type openai \
--endpoint https://openrouter.ai/api/v1 \
--model anthropic/claude-3.5-sonnet --api-key sk-or-xxxx

创建成功会返回后端 ID(如 local 或随机 ID)。

4. 测试连接

neomind llm test local

返回模型信息和响应状态 = 连接正常。

5. 设为默认

neomind llm activate local

6. 其他常用命令

# 查看后端详情(含能力标签)
neomind llm get local

# 更新模型或参数
neomind llm update local --model qwen3.5:8b --temperature 0.5

# 删除后端
neomind llm delete local
📖 CLI 参数速查
命令说明关键参数
llm list列出所有后端
llm get <id>查看详情
llm models列出 Ollama 可用模型--endpoint <url>
llm create创建后端--name --type --endpoint --model --api-key --temperature
llm update <id>更新配置--model --endpoint --api-key --temperature
llm test <id>测试连接
llm activate <id>设为默认
llm delete <id>删除

思考力度(Thinking Effort)

对支持推理的模型,可在后端能力面板统一控制思考力度:none / low / medium / high(部分后端支持更细档位)。NeoMind 把这一控制抽象为单一开关并自动映射到各后端的原生参数——Ollama 的 think 级别、OpenAI / 自定义 / GLM / Google 的 reasoning_effort、DeepSeek / Anthropic 的 thinking、Qwen 的 enable_thinking;不支持推理的后端会显示为只读徽标。



Ollama 端点

NeoMind 调用 Ollama 的原生 /api/chat 端点(不是 /v1/chat/completions)——因此支持思维链(thinking)、原生多模态与 Ollama 原生流式/工具调用协议。自测时的 curl 示例与常见 404 排查见 故障排查 — LLM / Ollama

多模态(视觉)能力

NeoMind 支持图像输入与视觉分析。视觉能力的启用取决于模型:

  • Ollama:拉取视觉模型(如 qwen3.5:4b-vl / llava / minicpm-v)后,在 AI Chat 中可直接上传图片提问。
  • 云端gpt-4o / gpt-4o-mini / claude-sonnet-4-5 / gemini-2.5-flash / qwen-vl / glm-4v 等天然支持视觉。

NeoMind 会自动探测模型的多模态能力(通过 LiteLLM 注册表 + /api/show 运行时探测 + 名称启发式匹配)。如果自动探测不准,可在后端详情页手动覆盖 Multimodal 开关。

设置默认后端

一个 NeoMind 实例可配置多个 LLM 后端,但只有一个被标记为默认。默认后端用于:

  • AI Chat 的初始对话
  • 计划型 Agent 的执行
  • 规则引擎中的 LLM 分析
切换默认
  • Web UI:AI Chat 顶部模型选择器 → 点选要设为默认的后端
  • CLI
# 查看所有后端及当前默认
neomind llm list

# 将指定后端设为默认
neomind llm activate local

下一步


最后更新: 2026-09-08