欢迎来到威聚
威扬盘搜

DeepSeek-OCR

AI 工具 Python MIT Python AI 总结 推荐 ★4 中等

更新于 2026-09-03 15:28:51 · 创建于 2026-09-03 15:22:51

DeepSeek-OCR(deepseek-ai/DeepSeek-OCR)是 DeepSeek 开源的视觉语言 OCR 模型,全称 “Contexts Optical Compression”。它从“以 LLM 为中心”的视角重新设计视觉编码器,探索视觉-文本压缩的边界,既是专用 OCR 引擎,也是通用 VLM。

它做什么

  • 自由 OCR:直接对图片做文字识别。
  • 文档转 Markdown:带版面定位(layout grounding),把 PDF/扫描件转成结构化 Markdown。
  • 通用图像理解:描述图片、解析图表(Figure parsing)、按引用定位区域(reference localization)。
  • 多分辨率档位:原生 Tiny 512²(64 token) / Small 640²(100) / Base 1024²(256) / Large 1280²(400),动态 “Gundam” 模式可拼接多图。

工程视角

Python 实现(MIT),推理走 vLLM(高吞吐,A100-40G 上 PDF 约 2500 tokens/s)或 HuggingFace transformers(AutoModel)。2025-10-20 首发,2026-01-27 已推出 DeepSeek-OCR2。适合需要把文档/图片高效转文本、又想保留版面结构的场景。

一句话总结

DeepSeek-OCR 是 DeepSeek 开源的视觉语言 OCR 模型:文档转 Markdown、图文识别、图表解析一锅端,多分辨率压缩视觉 token,vLLM 高吞吐,开源可自部署。

按更新时间依次阅读