返回插件库
dsh-vision-router 封面

dsh-vision-router

粘贴图片就能用:内置免费视觉链路 + 14 个深度视觉工具,免 key 免 Python

github.com/ysr666/dsh-vision-router
964 MIT 作者 ysr666 更新于

安装

dsh plugin --profile web add dsh-vision-router

界面预览 3

dsh-vision-router

粘贴图片就能用:内置免费视觉链路开箱即用,DeepSeek 继续思考,视觉模型只负责”看”——免 key、免 Python、一条命令装好。

解决什么问题

纯文本模型在 DSH 上看不了图,而多数视觉插件是把图片转成”文字描述”再喂给模型——有损、一次性、看不到像素细节,GUI 定位和 UI 还原这类活根本做不了。常见的视觉方案又要求 API key 或 Python 环境,门槛不低。

这个插件换了一条路:把”看图”变成一次普通工具调用——原始像素保留在视觉模型侧,DeepSeek 只在推理侧。agent 自己按需调用 vision_ground(像素级定位)、vision_cropvision_pixel_diff(像素差异)等多步迭代,直到任务完成;看图回合和普通工具调用回合一样可落地、可度量、可复现。内置 OVHcloud 匿名回退链路(5 个模型)免账号免 key,自备视觉模型优先、失败自动降级。

核心功能

  • 开箱即用的免费视觉链路:内置 OVHcloud 匿名回退(5 个模型),无需账号与 key;自备模型优先、失败自动逐级降级
  • 14 个深度视觉工具vision_ground(原图像素框定位)、vision_detectvision_cropvision_pixel_diffvision_describevision_ocrvision_tracevision_extract_foregroundvision_html_screenshot 等,另有默认关闭的桌面截图工具
  • 整轮自动路由:在模型选择器选 ”+ Auto Vision” 组,粘贴图片后整轮自动交给视觉链路,原模型组保持不变
  • 图像记忆:答案按图片内容哈希缓存,后续文字回合复用记录,不重复消耗视觉调用
  • 可验证的像素闭环:参考图 → 截图 → vision_pixel_diff 差异比 + 热力图 → 修复 → 重复,UI 还原从”凭感觉”变成可量化
  • 本地视觉后端:可选 Ollama / LM Studio 本地识别,离线、免费、私密
  • 无 Python 依赖:sharp / potrace / tesseract / 系统 Chrome 完成缩放、定位、裁剪、OCR、SVG 描摹与截图

快速上手

一条命令安装后,在聊天输入框右下角的模型选择器里选一个带 ”+ Auto Vision” 的组,然后正常粘贴或上传图片即可。例如让 agent 用 vision_ground 定位”发送按钮”并返回坐标、用 vision_pixel_diff 对比参考图与实现截图、或对长截图做 vision_long_screenshot_ocr。本地视觉可在设置或 profile patch 里开启 localOllama / localLmStudio

适合谁

  • 想给纯文本 DeepSeek 配上”眼睛”、又不想配 key、装 Python 的 DSH 用户
  • 需要 GUI 定位、像素级操作与 UI 还原量化验收的开发者与测试
  • 想用本地 Ollama / LM Studio 做离线、私密识别的用户
标签 工具集成

内容根据项目 README 整理 · 版权归原作者所有

报告问题 / 申请下架

相关插件