跳转到内容

模型准备

IAI 不随产品分发任何模型权重:权重体积大,也受第三方许可约束。本页说明如何自行准备。

  1. 从 Ollama 官网安装 Ollama,确认服务在本机 11434 端口运行。

  2. 拉取对话模型和向量模型:

    终端窗口
    ollama pull qwen2.5:7b
    ollama pull bge-m3

    显存较小(8 GB 以下)时,可以把对话模型换成 qwen3.5:4b。

  3. 启动试用版。首次启动时,试用版会检测本机 Ollama 里的可用模型,按 qwen2.5:7b、qwen3.5:4b 的顺序自动选用;之后也可以在设置里切换。

参考配置:8 GB 显存(如 RTX 4060)可以同时常驻 7B 的 4 bit 量化对话模型和 bge-m3。

在试用版设置里选择“云端模型”,填写:

  • 接口地址:任意 OpenAI 兼容接口;
  • API Key:你自己的 Key,安装包里不内置任何 Key;
  • 模型名称:例如 deepseek-chat。

选择云端模型意味着对话内容会发送到对应服务商,试用版会先征得你的同意。

  • 在 24 GB 显存的单卡上,可以用 vLLM 运行 30B 级 MoE 模型的 4 bit 量化版本(例如 Qwen3-30B-A3B 的 GPTQ-Int4 版本),兼顾速度与多轮工具调用所需的上下文;
  • 显存更大时可以选择更大的模型;显存有限时,优先保证上下文长度,而不是一味追求参数量;
  • 模型权重首次下载体积约 10–20 GB。无外网的工厂,可以在外网环境下载后离线拷入。

AI 网关统一注册四类模型:OpenAI 兼容接口、Anthropic、Ollama、vLLM,并支持故障转移。企业已有模型服务时,在“设置 → 模型凭据”中登记即可,不需要改代码。

部分模型(如 Qwen3 系列)默认会先输出一段思考过程。IAI 的意图路由需要直接的结构化输出,接入这类模型时请关闭思考模式,否则可能出现意图识别失败、回答为空等问题。