Prism-Qwen3VL 是一个强大的 ComfyUI 自定义节点集合,深度集成了阿里云 Qwen 团队开发的 Qwen3-VL 多模态大语言模型系列。
本项目旨在为 ComfyUI 用户提供流畅、高效的视觉大模型体验,支持图像理解、视频分析、智能反推提示词以及批量打标等高级功能。
- 🖼️ 深度图像理解: 详细分析和描述图像内容,支持多轮对话。
- 🎥 视频流分析: 支持处理视频帧序列,理解动态视频内容。
- 📝 智能提示词生成: 为文生图 (Text-to-Image) 生成优化的提示词(Prompt)。
- 📂 批量自动化处理:
- 批量打标: 自动扫描文件夹,为数据集生成 Caption。
- 对比打标: 专为修图/重绘场景设计,自动分析“原图 vs 结果图”的差异并生成 Prompt。
- 🧩 模块化设计: 支持自定义 System Prompt 和额外的参数控制节点。
本项目支持 Qwen3-VL 全系列模型,并兼容 Qwen2.5-VL。
| 模型版本 | 完整精度 (FP16) | 8-bit 量化 | 4-bit 量化 | FP8 版本 |
|---|---|---|---|---|
| 2B-Instruct | 4GB | 2.5GB | 1.5GB | 2.5GB |
| 4B-Instruct (标准) | 6GB | 3.5GB | 2GB (推荐) | 2.5GB |
| 8B-Instruct | 12GB | 7GB | 4.5GB | 7.5GB |
| 32B-Instruct | 28GB | 14GB | 8.5GB | 24GB |
注意: 系统会自动根据你的显存大小调整量化级别。FP8 模型需要计算能力 >= 8.9 的 GPU (如 RTX 4090)。
进入你的 ComfyUI 插件目录: cd ComfyUI/custom_nodes git clone https://github.com/你的用户名/ComfyUI-Prism-Qwen3VL.git cd ComfyUI-Prism-Qwen3VL (请将 你的用户名 替换为你实际的 GitHub 用户名)
- 安装依赖 pip install -r requirements.txt
- 可选加速 (推荐) 如果你使用的是 NVIDIA 显卡 (30系/40系),建议安装 Flash Attention 2 以获得极致性能: pip install flash-attn --no-build-isolation
🗂️ 模型下载与路径 本项目采用自动管理机制。首次运行节点时,模型会自动下载。 默认存储路径: ComfyUI/models/prompt_generator/ 下载源: 支持 Hugging Face (默认) 和 ModelScope (国内加速)。
🚀 节点说明
- Prism-Qwen3VL Advanced (核心节点) 处理单图、多图或视频帧的主节点。
输入: 图像/视频、提示词。
输出: 文本描述。
特性: 支持种子控制、温度调节、上下文长度设置。
- Prism-Qwen3VL Batch Caption (批量打标) 功能: 指向一个文件夹,自动为里面的所有图片生成 .txt 描述文件。
适用: LoRA 训练集打标、图像库整理。
特性: 支持断点续传(跳过已存在文件)、自定义前缀/后缀。
- Prism-Qwen3VL Compare (对比分析) 功能: 输入“原图文件夹”和“修图后文件夹”,AI 自动分析两者的区别。
适用: 反推 Inpainting 或修图工作流的 Prompt。
- Prism-Qwen3VL Chat (智能对话) 模拟 ChatGPT 的多模态对话体验,支持自定义 System Character(系统角色)。
🤝 致谢 本项目基于以下开源项目进行开发和改进,特此致谢:
Qwen Team: 提供了卓越的 Qwen3-VL 基础模型。
ComfyUI: 提供了强大的节点式工作流框架。
ComfyUI-Qwen3VL-DP: 本项目的原始代码基础。
Prism-Qwen3VL | 基于 Qwen3-VL 的新一代视觉理解工具