Skillsdsh-plugin

vision-translation

DeepSeek Harness 视觉翻译插件:通过辅助 VLM 桥把图片转成结构化 <vision-context> 基元,让纯文本 Agent 也能感知视觉信息。

Stars
0
Forks
0
Open Issues
0
最近 Push
2026年8月22日
最新版本
—
24h Growth
+0
7d Growth
+0

安装

暂未自动识别可靠的安装命令,请查看项目 README。

概览

DeepSeek Harness 视觉翻译插件:通过辅助 VLM 桥把图片转成结构化 <vision-context> 基元,让纯文本 Agent 也能感知视觉信息。

  • 将图片转为结构化 `<vision-context>` 文本基元,供纯文本 Agent 使用。
  • 辅助 VLM 负责看图,Core 统一生成 norm-1000 xyxy 视觉基元。
  • 空间关系(left_of/right_of/above/below/inside/overlaps)由几何计算而非语言猜测。
  • 提取 OCR 可见文本并纳入输出上下文。
  • 失败关闭:三次无效 VLM 输出后返回 unavailable,绝不编造内容。
  • 兼容任意 OpenAI 兼容 /chat/completions 端点;默认与 OpenRouter 兼容。
  • 提供 Hermes 原生 Bridge、通用 MCP Bridge 与跨语言 CLI 入口。
  • Core 运行时仅需 Python 标准库;可选 Pillow 用于旋转和缩放。

相关插件