本帖最后由 heishijie 于 2026-8-9 18:28 编辑
个人感觉挺好的~对电脑配置要求不高
llama.cpp部署模型
版本:llama-b9993-bin-win-cuda-13.3-x64
(可能有些网络访问不佳-有外网用外网友好一点)
模型下载地址:
里面有多模型
模型里总共有3个版本:F16是满血全精度版(推荐下载),大小只有2G左右,对显卡几乎没什么要求,只要你的显存是2G左右的就足够,Q8量化版大小是1G左右,如果你的显存是低于2G的,那么你就选择Q8版,当然如果你用CPU或者微型设备,那么就选择最小的Q4量化版即可!
下面是操作:
创建一个目录放入模型
按自己下载的版本选择
我这里输入3 回车
这里输入1回车
Think(深度思考) 和 No Think(快速模式)
会弹出网页即可使用
如果要对接软件用:
http://127.0.0.1:8080/v1
模型:[color=oklch(0.145 0 0)][backcolor=oklch(1 0 0)]MiniCPM5-1B-F16
[color=oklch(0.145 0 0)][backcolor=oklch(1 0 0)]其他随便
|