dsh-vision-router
粘贴图片就能用:内置免费视觉链路 + 14 个深度视觉工具,免 key 免 Python
安装
dsh plugin --profile web add dsh-vision-router 界面预览 3
dsh-vision-router
粘贴图片就能用:内置免费视觉链路开箱即用,DeepSeek 继续思考,视觉模型只负责”看”——免 key、免 Python、一条命令装好。
解决什么问题
纯文本模型在 DSH 上看不了图,而多数视觉插件是把图片转成”文字描述”再喂给模型——有损、一次性、看不到像素细节,GUI 定位和 UI 还原这类活根本做不了。常见的视觉方案又要求 API key 或 Python 环境,门槛不低。
这个插件换了一条路:把”看图”变成一次普通工具调用——原始像素保留在视觉模型侧,DeepSeek 只在推理侧。agent 自己按需调用 vision_ground(像素级定位)、vision_crop、vision_pixel_diff(像素差异)等多步迭代,直到任务完成;看图回合和普通工具调用回合一样可落地、可度量、可复现。内置 OVHcloud 匿名回退链路(5 个模型)免账号免 key,自备视觉模型优先、失败自动降级。
核心功能
- 开箱即用的免费视觉链路:内置 OVHcloud 匿名回退(5 个模型),无需账号与 key;自备模型优先、失败自动逐级降级
- 14 个深度视觉工具:
vision_ground(原图像素框定位)、vision_detect、vision_crop、vision_pixel_diff、vision_describe、vision_ocr、vision_trace、vision_extract_foreground、vision_html_screenshot等,另有默认关闭的桌面截图工具 - 整轮自动路由:在模型选择器选 ”+ Auto Vision” 组,粘贴图片后整轮自动交给视觉链路,原模型组保持不变
- 图像记忆:答案按图片内容哈希缓存,后续文字回合复用记录,不重复消耗视觉调用
- 可验证的像素闭环:参考图 → 截图 →
vision_pixel_diff差异比 + 热力图 → 修复 → 重复,UI 还原从”凭感觉”变成可量化 - 本地视觉后端:可选 Ollama / LM Studio 本地识别,离线、免费、私密
- 无 Python 依赖:sharp / potrace / tesseract / 系统 Chrome 完成缩放、定位、裁剪、OCR、SVG 描摹与截图
快速上手
一条命令安装后,在聊天输入框右下角的模型选择器里选一个带 ”+ Auto Vision” 的组,然后正常粘贴或上传图片即可。例如让 agent 用 vision_ground 定位”发送按钮”并返回坐标、用 vision_pixel_diff 对比参考图与实现截图、或对长截图做 vision_long_screenshot_ocr。本地视觉可在设置或 profile patch 里开启 localOllama / localLmStudio。
适合谁
- 想给纯文本 DeepSeek 配上”眼睛”、又不想配 key、装 Python 的 DSH 用户
- 需要 GUI 定位、像素级操作与 UI 还原量化验收的开发者与测试
- 想用本地 Ollama / LM Studio 做离线、私密识别的用户
内容根据项目 README 整理 · 版权归原作者所有
报告问题 / 申请下架