DeepSeek Harness 插件库
🔍 English

怎么让 DeepSeek Harness 看图:视觉插件全解析

纯文本模型很强,直到你需要它东西。DSH 社区高频问题:“怎么让 DeepSeek Harness 看图?” 答案是视觉插件。这篇把选项讲清楚。

一句话结论

纯文本模型的 Harness 不能直接看图,视觉插件用两种方式补齐:

  1. 视觉桥接——把图发给视觉模型,拿回结构化结果
  2. 视觉工具包——图片问答、OCR、截图、UI 还原、GUI 自动化

三个关键插件:

各自怎么用

modlens —— 图变成证据

最直接的”让模型看见”:对话里贴图,智能体拿到结构化 JSON(OCR、布局、语义)并据此推理。零 Python、一条命令装好。

dsh plugin add github:liustack/modlens

dsh-vision-toolkit —— 带意图的视觉

专为纯文本模型设计:能”就图提问”,能做长截图 OCR(文档、网页截图都行),能从截图还原 UI。它会识别每次视觉请求的意图再分流处理。

agent-vision-toolkit —— 视觉 + GUI 自动化

重量级选手:多图理解、图片问答、长截图 OCR、前端 UI 还原、GUI 自动化,外加技能封装。想让智能体”看到界面并操作它”,选这个。

按场景对号入座

  • “看看这个报错截图,告诉我哪里错了” → modlens
  • “把这张长网页/PDF 截图 OCR 出来” → dsh-vision-toolkit
  • “照着截图把 UI 还原出来” → dsh-vision-toolkit / agent-vision-toolkit
  • “点屏幕上你能看到的那个按钮” → agent-vision-toolkit(GUI 自动化)

配置提醒

视觉插件需要一个能看图的模型。大多数接受任意 OpenAI 兼容 VLM 端点(比如国产免费档)。目录里每个插件页都链了具体配置步骤。

更多选择见工具与能力分类,或搜索 vision

结论

总被”我看不了这张图”卡住的话,先装 modlens——从纯文本到”智能体能读截图”最快的一条路;要大规模 OCR 或 UI 还原再加 dsh-vision-toolkit

DeepSeek Harness 插件常见问题

DeepSeek Harness 能看图吗?

纯文本模型不行,但视觉插件可以补:modlens 和 dsh-vision-toolkit 把图片交给视觉模型并返回结构化结果;agent-vision-toolkit 额外支持图片问答、OCR 和 GUI 自动化。

哪个 DeepSeek Harness 视觉插件最好?

想把图片转成结构化 JSON 证据选 modlens;需要带意图的图片问答和长截图 OCR 选 dsh-vision-toolkit;还要 GUI 自动化选 agent-vision-toolkit。

怎么安装视觉插件?

一条命令:dsh plugin add github:liustack/modlens。视觉插件通常需要配置一个兼容的视觉模型(OpenAI 兼容的 VLM 端点)。

← 返回博客