怎么让 DeepSeek Harness 看图:视觉插件全解析
纯文本模型很强,直到你需要它看东西。DSH 社区高频问题:“怎么让 DeepSeek Harness 看图?” 答案是视觉插件。这篇把选项讲清楚。
一句话结论
纯文本模型的 Harness 不能直接看图,视觉插件用两种方式补齐:
- 视觉桥接——把图发给视觉模型,拿回结构化结果
- 视觉工具包——图片问答、OCR、截图、UI 还原、GUI 自动化
三个关键插件:
- modlens —— 视觉桥接:贴图即得结构化 JSON 证据
- dsh-vision-toolkit —— 带意图的图片问答、长截图 OCR、UI 还原
- agent-vision-toolkit —— 编码智能体的完整视觉 + GUI 自动化
各自怎么用
modlens —— 图变成证据
最直接的”让模型看见”:对话里贴图,智能体拿到结构化 JSON(OCR、布局、语义)并据此推理。零 Python、一条命令装好。
dsh plugin add github:liustack/modlens
dsh-vision-toolkit —— 带意图的视觉
专为纯文本模型设计:能”就图提问”,能做长截图 OCR(文档、网页截图都行),能从截图还原 UI。它会识别每次视觉请求的意图再分流处理。
agent-vision-toolkit —— 视觉 + GUI 自动化
重量级选手:多图理解、图片问答、长截图 OCR、前端 UI 还原、GUI 自动化,外加技能封装。想让智能体”看到界面并操作它”,选这个。
按场景对号入座
- “看看这个报错截图,告诉我哪里错了” → modlens
- “把这张长网页/PDF 截图 OCR 出来” → dsh-vision-toolkit
- “照着截图把 UI 还原出来” → dsh-vision-toolkit / agent-vision-toolkit
- “点屏幕上你能看到的那个按钮” → agent-vision-toolkit(GUI 自动化)
配置提醒
视觉插件需要一个能看图的模型。大多数接受任意 OpenAI 兼容 VLM 端点(比如国产免费档)。目录里每个插件页都链了具体配置步骤。
结论
总被”我看不了这张图”卡住的话,先装 modlens——从纯文本到”智能体能读截图”最快的一条路;要大规模 OCR 或 UI 还原再加 dsh-vision-toolkit。
DeepSeek Harness 插件常见问题
DeepSeek Harness 能看图吗?
纯文本模型不行,但视觉插件可以补:modlens 和 dsh-vision-toolkit 把图片交给视觉模型并返回结构化结果;agent-vision-toolkit 额外支持图片问答、OCR 和 GUI 自动化。
哪个 DeepSeek Harness 视觉插件最好?
想把图片转成结构化 JSON 证据选 modlens;需要带意图的图片问答和长截图 OCR 选 dsh-vision-toolkit;还要 GUI 自动化选 agent-vision-toolkit。
怎么安装视觉插件?
一条命令:dsh plugin add github:liustack/modlens。视觉插件通常需要配置一个兼容的视觉模型(OpenAI 兼容的 VLM 端点)。