dsh-vision-toolkit
面向纯文本模型的综合视觉工具箱:意图式图片问答、长截图 OCR、UI 还原
安装
dsh plugin --profile web add @anionex/dsh-vision-toolkit 界面预览 5
dsh-vision-toolkit
给纯文本模型装上一副”会找重点”的眼睛:粘贴图片,意图驱动的问答、长截图 OCR 与 UI 还原一次到位,免 key 开箱即用。
解决什么问题
在 DSH 里用 DeepSeek 等纯文本模型时,模型看不到截图、描述抓不住重点、按钮没有可用坐标、UI 还原”改得差不多”却没法量化剩余差异。这个插件是 DSH 生态里较早的综合视觉工具箱:在 DSH Web 粘贴图片后,纯文本路由自动切到 (Vision Toolkit) 变体,无需手动复制路径或换模型。
视觉任务由意图驱动——agent 会为当前任务提取证据(“错误在哪?""按钮在哪?”),而不是只返回一句泛泛的图片描述;能力覆盖带意图的图片问答、长截图 OCR、前端 UI 还原与 GUI 视觉任务,Web 与 headless 两个 profile 共用同一套结构化结果。内置免费 Gemini 3.7 Flash 视觉服务,装完即用、无需 API key(共享额度临时耗尽时返回可读的 429 与重试指引)。
核心功能
- 意图式图片问答:用户消息或模型陈述成为焦点提示,返回针对当前任务的描述,而非泛泛配文
- 自动路由:粘贴图片自动切到
<model> (Vision Toolkit)变体,保留原生缩略图、会话历史与工作区路径 - 内置免费视觉服务:Gemini 3.7 Flash 装完即用、无需 API key;共享额度耗尽返回可读 429 与 Retry-After
- 长截图 OCR:重叠分块 + tesseract / 视觉模型回退,拼接成 Markdown
- UI 还原:从参考截图重建可编辑的 HTML / CSS
- 可量化视觉验收:坐标、差异对比、截图核对等 GUI 视觉任务
- 自带视觉模型:支持 OpenAI 兼容与 Anthropic Messages 端点(含 Groq + Qwen3.6-27B 免费教程),密钥存为 DSH Credential
- vision-skills 技能:内置上游 5 个 playbook,粗到细方法与任务 SOP 完整保留
快速上手
安装后重启 Web profile 并刷新页面,直接粘贴图片即可;也可把图放进会话工作区后调用 /vision-skills。要换模型或端点,在”设置 → Vision Toolkit”里配置 provider 并把密钥存为 DSH Credential,或用 profile patch 覆盖 baseUrl / credential / model;自签证书或 MITM 代理的内部端点可设 VISION_SSL_VERIFY=0。
适合谁
- 用纯文本模型跑 DSH、却需要看图理解与 GUI 自动化任务的用户
- 需要”可量化视觉验收”(坐标、差异、截图对比)的开发者与测试人员
- 想做前端 UI 还原、长截图 OCR 的创作者与前端工程师
内容根据项目 README 整理 · 版权归原作者所有
报告问题 / 申请下架