AI 视觉与 OCR
从图片提取文字、理解图表内容、识别手写笔记——AI 视觉让你的笔记图片不再只是"附件"。
可以做什么
| 场景 | 说明 |
|---|---|
| 📄 截图转文字 | 网页截图、PDF 截图 → 可编辑文本 |
| ✍️ 手写识别 | 白板照片、手写笔记 → 数字文本 |
| 📊 图表理解 | 数据图表 → 结构化数据 + 描述 |
| 🖼️ 图片描述 | 自动为图片生成 alt 文本 |
| 📑 PDF OCR | 扫描版 PDF → 可搜索文本 |
方案选型
云端方案(推荐入门)
| 服务 | 优势 | 价格 |
|---|---|---|
| GPT-4V / GPT-4o | 最强的综合视觉理解 | API 按量付费 |
| Claude 3.5 Sonnet | 图表理解优秀 | API 按量付费 |
| Google Gemini | 免费额度大 | 有免费层 |
| 百度 OCR | 中文识别强 | 免费额度 |
本地方案(隐私优先)
| 工具 | 适用场景 |
|---|---|
| Ollama + LLaVA | 通用视觉理解 |
| Tesseract.js | 纯 OCR 文字提取 |
| PaddleOCR | 中文 OCR(高精度) |
| Text Extractor 插件 | Obsidian 原生 OCR |
配置 Text Extractor 插件
这是最便捷的 Obsidian OCR 方案:
安装
1. 设置 → 第三方插件 → 浏览 → 搜索 Text Extractor
2. 安装并启用
3. 首次使用时自动下载 OCR 模型(约 50MB)使用场景
图片右键 → 提取文字 → 自动粘贴到笔记
PDF 阅读 → 选中区域 → 提取文字 → 插入批注
截图 → 快捷键提取 → 文本出现在笔记中使用 AI 视觉模型深度理解图片
场景一:手写笔记数字化
用 GPT-4V 识别白板照片:
markdown
## Prompt
请将以下白板照片中的内容整理为结构化笔记:

要求:
1. 识别所有文字和图形
2. 保持原有的逻辑层次
3. 用 Markdown 格式输出
4. 标注不确定的部分场景二:架构图转文档
markdown
当你在图片中看到这样的提示:
> 上图是一个微服务架构图,请将其描述为文字架构文档。
AI 会输出:
## 系统架构
### 服务列表
- 用户服务:负责注册/登录/权限
- 订单服务:负责订单生命周期
- 支付服务:负责支付处理和回调
### 数据流
用户请求 → API Gateway → 微服务集群 → 数据库集群
### 技术栈
- 前端: React + TypeScript
- 后端: Go 微服务
- 消息队列: Kafka
- 数据库: PostgreSQL + Redis场景三:数据表格提取
markdown
## Prompt
请将以下截图中的表格转换为 Markdown 格式:
Ollama + LLaVA 本地方案
安装和配置
bash
# 1. 安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
# 2. 下载 LLaVA 模型(多模态)
ollama pull llava:13b
# 3. 在 Obsidian 中配置
# 插件:Text Generator / Copilot
# API: http://localhost:11434
# Model: llava:13b本地图片理解
curl http://localhost:11434/api/generate -d '{
"model": "llava:13b",
"prompt": "请描述这张图片的内容",
"images": ["$(base64 -i /path/to/image.png)"]
}'Templater 自动化图片处理
自动生成图片描述
配合 AI 插件,新建含图片笔记时自动生成描述:
javascript
// Templater User Script
async function describeImage(tp) {
const imagePath = tp.frontmatter.image;
if (!imagePath) return '';
// 调用 AI API 生成描述
const description = await tp.user.callAI({
prompt: "描述这张图片的内容,用于 alt 属性",
image: imagePath
});
return description;
}
module.exports = describeImage;模板中使用:
markdown
---
image: "assets/screenshot-{{date}}.png"
image_description: "<%* const desc = await tp.user.describeImage(tp); tR += desc %>"
---插件对比
| 插件 | 功能 | 适合场景 |
|---|---|---|
| Text Extractor | 纯 OCR 文字提取 | 扫描文档、截图转文字 |
| Copilot | AI 对话 + 图片理解 | 图片提问、图表解释 |
| Text Generator | 多模型 AI + 模板 | 自定义图片处理流程 |
| Smart Connections | 图片语义搜索 | 以图搜图、关联推荐 |
实战工作流
会议白板 → 结构化笔记
yaml
流程:
1. 手机拍照白板 → 自动同步到 Obsidian (iCloud/网盘)
2. 笔记中插入图片
3. 右键 → Text Extractor 提取文字
4. AI 插件整理格式 → 生成会议纪要论文图表 → 可分析数据
yaml
流程:
1. 截图论文中的图表
2. GPT-4V 分析图表 → 输出数据描述
3. 整理为 Obsidian 表格
4. Dataview 图表插件二次可视化手写笔记数字化
yaml
流程:
1. 实体笔记本 → 手机拍照
2. 同步到 Obsidian 仓库
3. AI 识别手写内容 → 转为 Markdown
4. 添加标签和双链注意事项
隐私考量
- 云端 API:图片会上传到服务商服务器,敏感内容慎用
- 本地方案:Ollama + LLaVA 完全离线,适合内部文档
- Text Extractor:OCR 模型本地运行,不上传
准确率
- 手写中文识别率约 85-90%,需要人工校对
- 复杂的财务报表、医学影像不建议完全依赖 AI
- 建议保留原始图片作为可信来源