OCRの魔法!Tesseractで画像からテキストを抽出する方法


OCRの魔法!Tesseractで画像からテキストを抽出する方法

tesseract-ocr/tesseract

2025-09-11

一言で言うと、Tesseractは画像やPDFから文字を読み取ってテキストデータに変換してくれるオープンソースのツールです。まるで画像に書かれた文字を魔法のように抜き出して、編集可能なテキストにしてくれる、そんな「お値段以上」の働きをしてくれます。

もともとHP(ヒューレット・パッカード)が開発し、現在はGoogleがスポンサーとなっているため、信頼性と継続的な改善が期待できます。しかも、主要なプログラミング言語から簡単に利用できるライブラリが多数提供されているのも嬉しいポイントです。

Tesseractは、単に文字を認識するだけでなく、多岐にわたるタスクでエンジニアの強力な味方になります。

データ入力の自動化
紙の書類やスキャンされた文書をOCRで読み取り、手作業でのデータ入力を自動化できます。たとえば、領収書の画像を読み取って金額や日付を自動で家計簿アプリに入力する、といったシステムが作れます。

検索可能なPDFの作成
スキャンしたPDFは通常、ただの画像ファイルで、中の文字を検索できません。Tesseractを使えば、不可視レイヤーとして文字情報を付加した、検索可能なPDFを作成できます。

画像内のテキスト分析
Webサイトやアプリのスクリーンショットに含まれるテキストを抽出して、分析やテストに利用できます。特定のメッセージが表示されたか確認する、といったE2Eテストにも応用可能です。

多言語対応
Tesseractは日本語を含む100以上の言語に対応しています。これにより、多言語の書類処理やグローバルなアプリケーション開発にも活用できます。

Tesseractの導入は、いくつかのステップで行います。まず、ローカル環境に本体をインストールし、次にプログラミング言語ごとのラッパーライブラリを導入するのが一般的です。ここでは、Pythonを例に見ていきましょう。

OSごとにインストール方法が異なります。

macOS
Homebrewを使用するのが簡単です。

brew install tesseract

Windows
公式GitHubリポジトリのダウンロードページからインストーラをダウンロードして実行します。

Ubuntu/Debian
aptコマンドでインストールできます。

sudo apt install tesseract-ocr

PythonからTesseractを呼び出すために、pytesseractという便利なライブラリを使います。pipで簡単にインストールできます。

pip install pytesseract
pip install Pillow # 画像処理ライブラリも一緒にインストール

次のコードは、画像ファイル(例
invoice.png)から日本語のテキストを読み取る例です。

import pytesseract
from PIL import Image

# Tesseractの実行ファイルのパスを指定します(Windowsの場合)
# pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract-OCR\tesseract.exe'

# 画像ファイルを読み込みます
image_path = 'invoice.png'
text = pytesseract.image_to_string(Image.open(image_path), lang='jpn')

# 読み取ったテキストを出力します
print(text)

# 読み取りたい言語を英語にする場合は lang='eng' とします
# 多言語を同時に読み取る場合は lang='eng+jpn'

このコードを実行すると、画像に書かれた文字がtext変数に文字列として格納されます。認識精度を上げるためには、画像の解像度を上げたり、前処理(ノイズ除去、二値化など)を施したりすることが重要です。


tesseract-ocr/tesseract




エンジニア必見!数式OCRの決定版「pix2tex」でドキュメント作成を爆速化

今日は特にソフトウェアエンジニアの皆様にとって、「数式を画像からLaTeXコードに変換する」という、ちょっと雲行きが怪しい作業を一気に晴れにする、素晴らしい技術の「pix2tex」をご紹介します!「はぁ~、またこの資料の数式をLaTeXで打ち直しかぁ。積分記号


【体験談】roboflow/supervisionが私のCVプロジェクトを変えた話

こんにちは!今回は、コンピュータービジョンのプロジェクトに取り組むソフトウェアエンジニアの皆さんにとって、まさに「痒い所に手が届く」ツールであるroboflow/supervisionについて、その魅力と使い方をたっぷりご紹介します。まるで、これまでバラバラだったパーツをピタッとつなぎ合わせてくれる接着剤のような存在で、開発効率がぐんとアップすること間違いなしですよ!


Daft:PythonとRustの二刀流でどんなデータも高速処理!

おっと、旦那、なんだいその渋い顔は。データ処理で困ってるとでもいうのかい? そんな旦那に、とっておきの江戸の秘伝、いや、世界の最先端技術を教えてやろうってんだ。今回のお題は、「Eventual-Inc/Daft」だ!なんだい、その顔は。「だふと?」だぁ? 違う違う!「Da-ft」って読むんだ。覚えておきな!


Pythonエンジニア必見:OCR・機械学習を実践するペーパーレス文書管理システム活用ガイド

今回ご紹介する「ペーパーレス文書管理システム」は、スキャンした紙の文書やPDFファイルなどをデジタルで一元管理するためのシステムです。特に、その強力なOCR(光学文字認識)機能と機械学習(Machine Learning)を活用した自動タグ付け・分類機能が特徴で、あなたのドキュメントを「検索可能な知識ベース」に変身させます。


Chronos入門:ソフトウェアエンジニアのための時系列予測AI活用術

こんにちは!お呼び立ていただきありがとうございます。時系列予測の分野で話題のChronosについて、ソフトウェアエンジニアの皆さんの視点から、分かりやすく、そしてフレンドリーにご説明しますね!「ランジェリーショップで悩む彼女」のように、たくさんの選択肢から「どれが一番自分に合うのかしら?」と迷う気持ち、よく分かります。時系列予測の世界も同じで、色々なモデルがあって迷っちゃいますよね。でも、Chronosはそんな悩みを解決してくれるかもしれませんよ!


AI開発の新星「Burn」:ソフトウェアエンジニアのための徹底解説!

「Burn」っていうのはね、まるで最新鋭のパトカーみたいなものさ!深い学習(Deep Learning)のためのフレームワークなんだけど、ただ速いだけじゃないんだ。柔軟性があって、効率的で、いろんな場所で使えるっていうのがすごいんだぞ!昔のフレームワークは、速さを求めると柔軟性が犠昧になったり、逆に柔軟性を追求すると遅くなったりすることがあったんだが、このBurnは、その両方を高いレベルで実現しているんだ。


AIがもたらす開発革命:Perplexicaで技術の海を航海せよ

これは、とあるソフトウェア開発チーム、「エボリューション・ワークス」の物語です。彼らはいつも新しい技術を探求し、より良いプロダクトを作ろうと奮闘していました。しかし、彼らの開発環境には、大きな課題がありました。それは「情報の断片化」です。新しいライブラリやフレームワークを使おうとすると、公式サイト、Stack Overflow、GitHubのissue、技術ブログなど、あちこちのサイトを巡回して情報を集めなければなりませんでした。まるで「宝探し」のようです。


水着選びに悩む彼女を救え!pathwaycom/llm-appで学ぶAIアプリケーション開発

ただ、今回はご要望に沿うように、説明の中では「大規模言語モデル(LLM)」という一般的な言葉を使うようにするね。さて、彼女の水着選びに悩む様子をコント風に…って、これはなかなか面白いお題だね! ソフトウェアエンジニアの視点から、この状況を「pathwaycom/llm-app」を使ってどう解決するか、コント形式で解説していくよ。