返回插件库
modlens 封面

modlens

给纯文本模型装上眼睛:聊天里直接粘贴图片即可解读

github.com/liustack/modlens
3.6k MIT 作者 liustack 更新于

安装

dsh plugin --profile web add @liustack/modlens

界面预览 5

modlens

给纯文本模型装上眼睛:聊天里直接粘贴图片,它就能像有视觉一样读给你听。

解决什么问题

DeepSeek、GLM 等主力聊天模型是纯文本的,看不懂图片。要在对话里”读”一张截图、报错或图表,以往要么换多模态模型,要么先把图存成文件再传路径。ModLens 把这件事变成”直接粘贴”:它是一个插件式视觉引擎,给纯文本模型装上视觉——无需保存文件,也无需单独配置视觉模型或 API key。

它对外暴露一个原生 modlens_read_image 工具,并自动发现 profile 里所有承载纯文本 DeepSeek / GLM 模型的路由,为每条路由包装一个 (modlens vision) 模型入口(选一次后记得住)。粘贴有两种方式:直接粘贴(图片作为私有临时文件进入输入框),或选 (modlens vision) 入口再粘贴(缩略图留在消息里,接近 Codex 体验);图片按需转成结构化证据,由同一底层路由作答。

核心功能

  • 直接粘贴读图:图片粘贴即读,不必先存成文件再传路径
  • 原生工具与路由:暴露 modlens_read_image 工具,自动为每条纯文本 DeepSeek / GLM 路由添加 (modlens vision) 入口,视觉模型自动排除
  • 六个内置引擎 + 故障切换:gemini-api、openai、anthropic、antigravity-cli、claude-cli、kimi-cli 组成故障切换链,meta.attempts 记录每次尝试、切换从不静默
  • 零配置起步:复用 Claude Code、Codex、OpenCode、Pi 已有的多模态登录;什么都没配时,Antigravity CLI 是免 key 的免费通道
  • 证据而非想象:完整转录、阅读顺序布局区域、实体与关系列表,模型引用的是具体内容
  • openai 万能插槽:任何 OpenAI 兼容端点(qwen-vl、GLM、SiliconFlow、OpenRouter、自托管 vLLM / Ollama)都能接入

快速上手

一条命令安装(版本号显式命名,便于 pnpm 11 正确解析):

npx -y @deepseek-ai/dsh plugin —profile web add @liustack/modlens@3.22.0

装好后直接聊天即可:粘贴图片或丢一个路径,插件自动触发,图片交给视觉引擎,回答建立在真实读取之上。引擎配置用 modlens config set provider <name> 设偏好、-p <name> 固定单一引擎,走代理可设 modlens config set proxy <url>

适合谁

  • 在 DSH 上使用纯文本模型、却经常需要看图(截图、报错、图表)的用户
  • 不想为”读图”单独配置视觉模型或 API key 的开发者
  • 希望读图结果可验证、引用具体证据而非泛泛而谈的用户
标签 Agent 增强

内容根据项目 README 整理 · 版权归原作者所有

报告问题 / 申请下架

相关插件