今天给大家分享 Qwen3.6 27B 最强无审查越狱版 AI 大模型,它集成了最新的 MTP 加速技术,支持本地部署,无需 API、无需联网、完全免费,最低只需 8GB 显存即可运行。手把手教大家完成模型下载安装部署。本视频仅供学习和技术研究,请大家遵守当地法律法规,合理使用。下面我们开始教程。

img

一、下载并安装 llama.cpp

下载地址:https://github.com/ggml-org/llama.cpp/releases

img

版本 适用硬件 说明
Windows x64 (CPU) Intel / AMD CPU 仅使用处理器运行
Windows arm64 (CPU) ARM 架构 Windows 设备 适用于骁龙 X Elite 等 ARM 平台
Windows x64 (CUDA 12) NVIDIA 显卡 推荐大多数 RTX / GTX 用户使用
Windows x64 (CUDA 13) NVIDIA 显卡 适用于较新的 NVIDIA 驱动
Windows x64 (Vulkan) AMD / Intel / NVIDIA 显卡 通用显卡加速版本
Windows x64 (SYCL) Intel Arc 显卡 Intel Arc 用户专用版本
Windows x64 (HIP) AMD Radeon 显卡 AMD 用户首选版本

注意:显卡用户别忘了下载下图主程序后面的 DLLs 文件,下载后把里面的内容解压到 llama.ccp 主程序的根目录里,不然无法使用显卡运行模型。

img

二、下载 Qwen3.6 27B 本地大模型

下载地址:https://huggingface.co/AIOpsInSpace/Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-MTP/tree/main

要求:显卡显存要求 8GB 左右及以上

下载到的大模型放到 llama.ccp 程序的根目录下的 models 目录里(需自行创建目录)

模型版本 文件大小 建议最低显存 推荐显存 适用人群
IQ2_M 10.5 GB 8 GB 10 GB 入门体验,显存较小用户
Q2_K_P 12 GB 10 GB 12 GB 兼顾速度与占用
IQ3_XS 12.4 GB 10 GB 12 GB 速度优先,画质略优于 Q2
IQ3_M 13 GB 10 GB 12 GB 综合性能均衡
Q3_K_P 14.8 GB 12 GB 16 GB 16GB 显卡推荐选择
IQ4_XS 15.5 GB 14 GB 16 GB 16GB 显卡最佳推荐,质量与速度兼顾
Q4_K_P 18 GB 16 GB 20 GB 高质量,16GB 显卡可勉强运行
Q5_K_P 21.3 GB 20 GB 24 GB 适合 RTX 4090、RTX 5090 等
Q6_K_P 23.6 GB 24 GB 24 GB+ 高端工作站显卡推荐
Q8_K_P 32.4 GB 32 GB 40 GB+ A6000、H100 等专业显卡

img

三、配置启动 Qwen3.6 27B

创建启动脚本,命名成:启动.bat

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
@echo off

title Qwen3.6-27B IQ2_M

cd /d "%~dp0"

llama-server.exe ^

-m "models\模型名称" ^

--host 127.0.0.1 ^

--port 8085 ^

-c 8192 ^

-ngl 999 ^

--flash-attn auto ^

--threads 16 ^

--cache-type-k q8_0 ^

--cache-type-v q8_0 ^

--temp 0.7 ^

--top-p 0.9

访问控制面板 URL:

http://127.0.0.1:8085

代码说明:

1
2
3
-m "models\模型名" ^

--port 端口号 ^

视频教程地址:【https://youtu.be/YYZeDaw4ITE