模型准备
IAI 不随产品分发任何模型权重:权重体积大,也受第三方许可约束。本页说明如何自行准备。
试用版:本机 Ollama
Section titled “试用版:本机 Ollama”-
从 Ollama 官网安装 Ollama,确认服务在本机
11434端口运行。 -
拉取对话模型和向量模型:
终端窗口 ollama pull qwen2.5:7bollama pull bge-m3显存较小(8 GB 以下)时,可以把对话模型换成
qwen3.5:4b。 -
启动试用版。首次启动时,试用版会检测本机 Ollama 里的可用模型,按
qwen2.5:7b、qwen3.5:4b的顺序自动选用;之后也可以在设置里切换。
参考配置:8 GB 显存(如 RTX 4060)可以同时常驻 7B 的 4 bit 量化对话模型和 bge-m3。
试用版:云端模型
Section titled “试用版:云端模型”在试用版设置里选择“云端模型”,填写:
- 接口地址:任意 OpenAI 兼容接口;
- API Key:你自己的 Key,安装包里不内置任何 Key;
- 模型名称:例如
deepseek-chat。
选择云端模型意味着对话内容会发送到对应服务商,试用版会先征得你的同意。
服务器版:vLLM
Section titled “服务器版:vLLM”- 在 24 GB 显存的单卡上,可以用 vLLM 运行 30B 级 MoE 模型的 4 bit 量化版本(例如 Qwen3-30B-A3B 的 GPTQ-Int4 版本),兼顾速度与多轮工具调用所需的上下文;
- 显存更大时可以选择更大的模型;显存有限时,优先保证上下文长度,而不是一味追求参数量;
- 模型权重首次下载体积约 10–20 GB。无外网的工厂,可以在外网环境下载后离线拷入。
服务器版:其他模型服务
Section titled “服务器版:其他模型服务”AI 网关统一注册四类模型:OpenAI 兼容接口、Anthropic、Ollama、vLLM,并支持故障转移。企业已有模型服务时,在“设置 → 模型凭据”中登记即可,不需要改代码。
关于“思考模式”
Section titled “关于“思考模式””部分模型(如 Qwen3 系列)默认会先输出一段思考过程。IAI 的意图路由需要直接的结构化输出,接入这类模型时请关闭思考模式,否则可能出现意图识别失败、回答为空等问题。
