DeepSeek-OCR
更新于 2026-09-03 15:28:51 · 创建于 2026-09-03 15:22:51
DeepSeek-OCR(deepseek-ai/DeepSeek-OCR)是 DeepSeek 开源的视觉语言 OCR 模型,全称 “Contexts Optical Compression”。它从“以 LLM 为中心”的视角重新设计视觉编码器,探索视觉-文本压缩的边界,既是专用 OCR 引擎,也是通用 VLM。
它做什么
- 自由 OCR:直接对图片做文字识别。
- 文档转 Markdown:带版面定位(layout grounding),把 PDF/扫描件转成结构化 Markdown。
- 通用图像理解:描述图片、解析图表(Figure parsing)、按引用定位区域(reference localization)。
- 多分辨率档位:原生 Tiny 512²(64 token) / Small 640²(100) / Base 1024²(256) / Large 1280²(400),动态 “Gundam” 模式可拼接多图。
工程视角
Python 实现(MIT),推理走 vLLM(高吞吐,A100-40G 上 PDF 约 2500 tokens/s)或 HuggingFace transformers(AutoModel)。2025-10-20 首发,2026-01-27 已推出 DeepSeek-OCR2。适合需要把文档/图片高效转文本、又想保留版面结构的场景。
一句话总结
DeepSeek-OCR 是 DeepSeek 开源的视觉语言 OCR 模型:文档转 Markdown、图文识别、图表解析一锅端,多分辨率压缩视觉 token,vLLM 高吞吐,开源可自部署。