不会看图的文字模型被装上可调用的眼睛,能读长截图、核对界面改没改对
用户可能使用其他视觉模型或手动检查,但公开材料未明确说明。
纯文本模型无法处理视觉任务,导致无法进行图片问答、OCR 和 UI 验证。
AI 应用的生意判断
不会看图的文字模型被装上可调用的眼睛,能读长截图、核对界面改没改对
01
从用户的一天开始 · 公开事实 + 可观察行为 · 2026-08-29
不会看图的文字模型被装上可调用的眼睛,能读长截图、核对界面改没改对
用户可能使用其他视觉模型或手动检查,但公开材料未明确说明。
纯文本模型无法处理视觉任务,导致无法进行图片问答、OCR 和 UI 验证。
趋势是短板做成可调用工具,不必等模型自己学会。不要做通用看图助手,先切界面验收、长截图读字、设计还原这种必须对屏幕核对的环节,插件免费、看图费用自理。
公开仓库有 525 个收藏和 26 个复刻,说明开发者关注,但持续使用和付费尚未核验。
① 远程工具调用的真实使用量/成本案例——"比多模态便宜一个量级"是否有人晒出账单; ② DeepSeek 官方是否出多模态模型——出了,它的远程工具价值减半; ③ star/测试是否随 DSH rc 迭代保持同步更新——跟慢就装不上
值得拆解。公开仓库有 525 个收藏和 26 个复刻,说明开发者关注,但持续使用和付费尚未核验。
AI 产品加能力,优先"工具化"而不是"模型化"——把能力做成可按需调用、带凭据管理、带输出的工具,比等模型升级快一个代际。同时抄"渐进式暴露":新能力默认不挂载,用到才加载,省 token 且缩小攻击面。 可借鉴。"插件免费、API 费自理"——工具类产品把成本外显、把软件价格归零,用户算得清账才敢用。它甚至写了 FUNDING.md 且声明赞助不买优先级,把"收费羞耻"处理得干净。
免费 + 自带 API 凭据模式。 插件本体 MIT 免费;远程视觉工具按用户自己的 OpenAI 兼容 API 凭据计费;本地工具完全免费。有可选赞助(FUNDING.md),声明不买优先级。 ① 远程工具调用的真实使用量/成本案例——"比多模态便宜一个量级"是否有人晒出账单; ② DeepSeek 官方是否出多模态模型——出了,它的远程工具价值减半; ③ star/测试是否随 DSH rc 迭代保持同步更新——跟慢就装不上
不会看图的文字模型被装上可调用的眼睛,能读长截图、核对界面改没改对
公开仓库有 525 个收藏和 26 个复刻,说明开发者关注,但持续使用和付费尚未核验。
追踪官方文档或 issue,确认用户对视觉功能的需求。
产品主张帮助用户完成:“不会看图的文字模型被装上可调用的眼睛,能读长截图、核对界面改没改对”。具体痛点强度与不采用代价尚未由用户证据核验。
价值闸门未通过,共识闸门未进入。
价值闸门未通过,模式闸门未进入。
价值闸门未通过,求真闸门未进入。
02
市场对照
尚未完成中英文市场对照。待覆盖范围和可核验证据补齐后再给出结论。
03
先给出判断与下一步,再保留完整证据和反例。
给纯文本模型装一双"可以调用的眼睛"——图片问答、长截图 OCR、UI 还原、像素对比这些视觉能力被做成 10 个工具,agent 按需调用,而不是假装模型自己会看图。
作者 Anionex(GitHub @Anionex,X @anion_ex,个人站 anionex.me)。他先做了上游通用视觉工具包 agent-vision-toolkit,再做了这个 DSH 原生集成层。仓库 2026-08-13 建,MIT,v0.1.4,44 提交。个人开源项目,带可选的 FUNDING.md 赞助通道(明确声明赞助不买路线图优先级、不买私人支持)。
判断:这是六件套里唯一有"上游资产"的作者——先做了通用的,再做集成的。这个顺序说明他是认真解决"文本模型没有视觉"这个真问题,而不是为了蹭 DSH 热度临时拼一个。
它明确不做:不重新实现任何视觉算法——算法全在上游 agent-vision-toolkit,这个插件只做 DSH 的集成层(生命周期、凭据、schema、Artifacts、Web 呈现)。职责拆分很干净。
DeepSeek 的旗舰文本模型不支持视觉(有实测明确说"V4 本身不支持视觉,想看图片场景还得额外搭配多模态模型")。以往给纯文本 agent 加视觉只有两条路:人肉转述——你把截图内容打字描述给模型听;或者拿通用工具链自己拼——写 Python/OpenAI API 胶水脚本,把图发给视觉 API 再贴结果回对话。每条路都是每次几十分钟的临时工,错误率高,还没法复用。
dsh-vision-toolkit 替代的就是这套"手工胶水脚本"。它把视觉封装成 agent 可调用的结构化工具:意图明确(定位 vs 检测 vs 描边)、有凭据管理、有 Artifacts 输出、有 Web 设置页。它还顺带替代了一个隐式旧行为——"用截图对比 UI 改没改对"这个 QA 动作(像素差工具 + UI 还原验证),原来靠人肉眼对比两屏。
免费 + 自带 API 凭据模式。 插件本体 MIT 免费;远程视觉工具按用户自己的 OpenAI 兼容 API 凭据计费;本地工具完全免费。有可选赞助(FUNDING.md),声明不买优先级。
判断:这是六件套里唯一把成本结构讲清楚的一个——"插件免费、推理费自理"是工具类 AI 插件的标准姿势,因为它本质上是个"调用编排器",钱花在模型 API 上而不是软件上。这也意味着它没有软件收入,只有影响力收入。
| 维度 | 结论 |
|---|---|
| 创始人-产品匹配度 | 先做上游通用工具包再做集成层,痛点是自己的,路径是连续的 |
| 产品洞察力 | "视觉是工具不是模型属性"+"意图感知执行"这两个判断都准,验证闭环(渲染→截图→像素差)是加分项 |
| 技术实现质量 | 136 测试、安全模型、双配置、锁定依赖版本,这批插件里工程最规范之一 |
| 市场时机 | 完美:DSH 官方文本模型不带视觉,这个缺口在 7 万星生态里是刚需;但远程工具依赖第三方视觉 API,成本链不稳 |
这是六件套里"产品"最接近成立的一个——有真能力、有验证、有清晰的成本边界。
它的核心判断值得所有 AI 产品抄:能力是工具,不是模型的属性。 模型不会看图,就给它一个会看图的工具,而不是等下一代模型。这个思路让"纯文本模型 + 视觉工具"在功能上等价于多模态模型,成本却便宜一个量级——DeepSeek 用户因此不必为了看一张截图就升级模型。
可迁移的规律:你产品的短板,可以用"可调用的外部工具"补,不必等主能力升级。 以及"渐进式暴露"——能力默认不加载,用到才挂载,既省 token 又缩攻击面,是给 agent 产品加能力时最该抄的安全姿势。
它的软肋:远程视觉工具依赖用户自备第三方 API 凭据,这意味着它是个"编排器",毛利为零;DeepSeek 官方哪天真出多模态模型,它的远程工具价值会被腰斩(本地工具还在)。它赌的是"文本模型 + 工具组合"这个范式继续成立。
① 远程工具调用的真实使用量/成本案例——"比多模态便宜一个量级"是否有人晒出账单 ② DeepSeek 官方是否出多模态模型——出了,它的远程工具价值减半 ③ star/测试是否随 DSH rc 迭代保持同步更新——跟慢就装不上
产品逻辑:AI 产品加能力,优先"工具化"而不是"模型化"——把能力做成可按需调用、带凭据管理、带输出的工具,比等模型升级快一个代际。同时抄"渐进式暴露":新能力默认不挂载,用到才加载,省 token 且缩小攻击面。
定价结构:可借鉴。"插件免费、API 费自理"——工具类产品把成本外显、把软件价格归零,用户算得清账才敢用。它甚至写了 FUNDING.md 且声明赞助不买优先级,把"收费羞耻"处理得干净。
值得关注。 六件套里最接近"真产品"的一个:能力真实、验证充分、成本边界清晰。"视觉工具化"和"渐进式暴露"两个机制可以直接抄走。它的天花板取决于 DeepSeek 官方出不出多模态——这个变量值得盯着看。
05
产品官网缺失或当前链接只是线索时,从这些检索入口继续核验。