1) 操作系统:推荐 Ubuntu 20.04/22.04 或 macOS;Windows 可用 WSL2。
2) Python:安装 Python 3.8+(建议使用 pyenv 或系统虚拟环境)。创建虚拟环境:python -m venv openclaw-env && source openclaw-env/bin/activate。
3) 硬件:若使用 GPU,确保安装合适的 NVIDIA 驱动和 CUDA(例如 CUDA 11.7)以及 cuDNN;否则准备足够的 CPU 内存用于量化模型(>16GB 推荐)。
1) 更新 pip:pip install -U pip setuptools wheel。
2) 安装 PyTorch(含 CUDA 支持):按照官方命令,例如 pip install torch torchvision --index-url https://download.pytorch.org/whl/cu117 。如无 GPU,请安装 CPU 版本。
3) 安装常见依赖:pip install numpy transformers sentencepiece tqdm。
1) 从官方仓库克隆(示例):git clone https://github.com/openclaw/openclaw.git && cd openclaw。
2) 安装:pip install -e . 或按项目 README 运行安装脚本(若有扩展依赖如 grpc、uvicorn 根据需要安装)。
3) 验证:执行 openclaw --help 或 python -c "import openclaw; print(openclaw.__version__)"。
1) 从 Hugging Face 或原始发布渠道下载模型权重(例如 glm-large/.pth 或 transformers 格式)。
2) 将权重放到工作目录,例如 models/glm-large/ 下,保证有 config.json、vocab 等必要文件。
3) 校验哈希或文件大小,避免不完整下载导致转换失败。
1) openclaw 常用的高效推理格式为 ggml 或自定义量化格式,项目通常提供转换脚本。示例:python tools/convert_to_ggml.py --input models/glm-large --output models/glm-large-ggml.bin。
2) 若需量化,加入 --quantize 选项并选择位宽(8/4-bit):python tools/convert.py --in weights.pth --out glm.q4.ggml --quant 4。
3) 转换后检查输出文件并记录内存/速度表现。
1) 在 openclaw/config 下新建模型配置文件(如 glm-large.yaml),指定模型路径、类型、tokenizer、设备(cpu/gpu)和线程数。示例字段:model_path: models/glm-large-ggml.bin;device: cpu;num_threads: 8。
2) 设置环境变量(可选):export OPENCLAW_CONF=./openclaw/config/glm-large.yaml。
3) 如果需要端口或 API key,按 README 填写 server 部分并保存。
1) 启动本地服务:openclaw serve --config openclaw/config/glm-large.yaml 或 python -m openclaw.server --config ... 。
2) 使用 curl 或客户端 SDK 测试:curl -X POST "http://localhost:8000/generate" -d '{"prompt":"你好","max_tokens":64}'。
3) 若推理报错,检查日志(默认在 logs/ 下)并回看模型路径、权限、内存是否足够。
1) 调整线程:num_threads 从 4 到 CPU 核心数尝试;观察延迟与吞吐。
2) 若内存不足,尝试更高比例的量化(q8->q4),或采用磁盘映射加载(mmap)。
3) GPU 下注意显存,必要时启用分片加载或混合精度;升级显卡驱动或 CUDA 版本以解决兼容性问题。
1) 将模型放在独立存储,使用容器化部署(Dockerfile 基于官方 Python 镜像,复制模型与配置)。
2) 加入健康检查与限流:使用 nginx/uWSGI 做反向代理并设置 /health 接口。
3) 监控内存、CPU、GPU 使用率,记录延迟与错误以便回滚或扩容。
答:不一定。openclaw 支持多种后端格式,但 GGML/量化格式在 CPU 上通常更高效。若你使用 PyTorch 后端或 GPU,直接使用 transformers 格式也可,但需确认 openclaw 的后端插件与转换工具是否兼容。
答:可采取分步转换、增加交换空间、使用低精度量化或在更大内存的机器上执行转换;另外检查转换脚本是否支持流式/分片转换选项。
答:使用几个已知 prompt 与参考输出比对(语义与格式),同时核对 tokenizer 的词表与配置一致性;若输出异常,先用官方 transformers 直接加载模型做对照排查差异。
