Skip to content

AI 视觉与 OCR

从图片提取文字、理解图表内容、识别手写笔记——AI 视觉让你的笔记图片不再只是"附件"。

可以做什么

场景说明
📄 截图转文字网页截图、PDF 截图 → 可编辑文本
✍️ 手写识别白板照片、手写笔记 → 数字文本
📊 图表理解数据图表 → 结构化数据 + 描述
🖼️ 图片描述自动为图片生成 alt 文本
📑 PDF OCR扫描版 PDF → 可搜索文本

方案选型

云端方案(推荐入门)

服务优势价格
GPT-4V / GPT-4o最强的综合视觉理解API 按量付费
Claude 3.5 Sonnet图表理解优秀API 按量付费
Google Gemini免费额度大有免费层
百度 OCR中文识别强免费额度

本地方案(隐私优先)

工具适用场景
Ollama + LLaVA通用视觉理解
Tesseract.js纯 OCR 文字提取
PaddleOCR中文 OCR(高精度)
Text Extractor 插件Obsidian 原生 OCR

配置 Text Extractor 插件

这是最便捷的 Obsidian OCR 方案:

安装

1. 设置 → 第三方插件 → 浏览 → 搜索 Text Extractor
2. 安装并启用
3. 首次使用时自动下载 OCR 模型(约 50MB)

使用场景

图片右键 → 提取文字 → 自动粘贴到笔记
PDF 阅读 → 选中区域 → 提取文字 → 插入批注
截图 → 快捷键提取 → 文本出现在笔记中

使用 AI 视觉模型深度理解图片

场景一:手写笔记数字化

用 GPT-4V 识别白板照片:

markdown
## Prompt

请将以下白板照片中的内容整理为结构化笔记:

![白板照片](/assets/whiteboard.jpg)

要求:
1. 识别所有文字和图形
2. 保持原有的逻辑层次
3. 用 Markdown 格式输出
4. 标注不确定的部分

场景二:架构图转文档

markdown
当你在图片中看到这样的提示:

> 上图是一个微服务架构图,请将其描述为文字架构文档。

AI 会输出:

## 系统架构

### 服务列表
- 用户服务:负责注册/登录/权限
- 订单服务:负责订单生命周期
- 支付服务:负责支付处理和回调

### 数据流
用户请求 → API Gateway → 微服务集群 → 数据库集群

### 技术栈
- 前端: React + TypeScript
- 后端: Go 微服务
- 消息队列: Kafka
- 数据库: PostgreSQL + Redis

场景三:数据表格提取

markdown
## Prompt

请将以下截图中的表格转换为 Markdown 格式:

![表格截图](/assets/table-screenshot.png)

Ollama + LLaVA 本地方案

安装和配置

bash
# 1. 安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh

# 2. 下载 LLaVA 模型(多模态)
ollama pull llava:13b

# 3. 在 Obsidian 中配置
# 插件:Text Generator / Copilot
# API: http://localhost:11434
# Model: llava:13b

本地图片理解

curl http://localhost:11434/api/generate -d '{
  "model": "llava:13b",
  "prompt": "请描述这张图片的内容",
  "images": ["$(base64 -i /path/to/image.png)"]
}'

Templater 自动化图片处理

自动生成图片描述

配合 AI 插件,新建含图片笔记时自动生成描述:

javascript
// Templater User Script
async function describeImage(tp) {
  const imagePath = tp.frontmatter.image;
  if (!imagePath) return '';

  // 调用 AI API 生成描述
  const description = await tp.user.callAI({
    prompt: "描述这张图片的内容,用于 alt 属性",
    image: imagePath
  });

  return description;
}

module.exports = describeImage;

模板中使用:

markdown
---
image: "assets/screenshot-{{date}}.png"
image_description: "<%* const desc = await tp.user.describeImage(tp); tR += desc %>"
---

插件对比

插件功能适合场景
Text Extractor纯 OCR 文字提取扫描文档、截图转文字
CopilotAI 对话 + 图片理解图片提问、图表解释
Text Generator多模型 AI + 模板自定义图片处理流程
Smart Connections图片语义搜索以图搜图、关联推荐

实战工作流

会议白板 → 结构化笔记

yaml
流程:
  1. 手机拍照白板 → 自动同步到 Obsidian (iCloud/网盘)
  2. 笔记中插入图片
  3. 右键 → Text Extractor 提取文字
  4. AI 插件整理格式 → 生成会议纪要

论文图表 → 可分析数据

yaml
流程:
  1. 截图论文中的图表
  2. GPT-4V 分析图表 → 输出数据描述
  3. 整理为 Obsidian 表格
  4. Dataview 图表插件二次可视化

手写笔记数字化

yaml
流程:
  1. 实体笔记本 → 手机拍照
  2. 同步到 Obsidian 仓库
  3. AI 识别手写内容 → 转为 Markdown
  4. 添加标签和双链

注意事项

隐私考量

  • 云端 API:图片会上传到服务商服务器,敏感内容慎用
  • 本地方案:Ollama + LLaVA 完全离线,适合内部文档
  • Text Extractor:OCR 模型本地运行,不上传

准确率

  • 手写中文识别率约 85-90%,需要人工校对
  • 复杂的财务报表、医学影像不建议完全依赖 AI
  • 建议保留原始图片作为可信来源

相关资源