PDFの壁を打ち破る:数式・表・多段組対応のデータ抽出ツール MinerUの威力


PDFの壁を打ち破る:数式・表・多段組対応のデータ抽出ツール MinerUの威力

opendatalab/MinerU

2025-10-14

ホテルのコンシェルジュのように、このツールをどのように活用できるか、導入方法、そしてサンプルコードまで、分かりやすく丁寧にご案内しますね。

MinerUは、一言でいうと「複雑なPDFなどの非構造化データを、大規模言語モデル(LLM)がすぐに使える、構造化されたデータ(MarkdownやJSON)に魔法のように変換してくれる」Pythonライブラリです。

PDFは、論文、契約書、技術仕様書、報告書など、重要な情報源でありながら、データとして扱うには非常に手間がかかります。従来のPDFパースは、レイアウトが崩れたり、表や数式が文字化けしたりと、苦労が絶えませんでした。

MinerUは、この「PDFからのデータ抽出と前処理の苦痛」を解消してくれます。

課題(Before MinerU)メリット(After MinerU)
データ前処理の地獄: PDFから手作業でコピペ、または複雑な正規表現やカスタムスクリプトで抽出。LLM-Readyなデータ: 高精度で構造を保ったMarkdownやJSONを自動生成。前処理時間が激減。
レイアウトの複雑さ: 多段組、ヘッダー/フッター、脚注が混在し、テキストがバラバラになる。正確な読み順の確保: 人間が読む自然な順序でテキストを再構成。エージェント(Agentic Workflow)の入力として最適。
非構造化データの壁: 表や数式をデータ化するのが困難。OCRが必要な場合もある。リッチなデータ抽出: 表をHTMLに、数式を$\LaTeX$に変換してくれます。スキャンPDFのOCRも自動で対応。
エージェント開発のボトルネック: 信頼性の低いPDF抽出結果が、エージェントの意思決定を歪ませる。信頼性の高い入力: クリーンで構造化されたデータにより、エージェントの処理精度と信頼性が向上。

MinerUはPythonで提供されています。セットアップは非常にシンプルです。

Python 3.8以上が必要です。仮想環境(venvやcondaなど)での作業を強くお勧めします。

pipを使って簡単にインストールできます。

# ターミナルで実行
pip install mineru

OCR機能など、特定の機能を利用する場合は、追加の依存関係をインストールすることが推奨されています。

# 拡張機能を使いたい場合はこちら
# 詳細な要件は公式のGitHubリポジトリをご確認ください。
# 例: pip install mineru[ocr, all] など

ここでは、PDFファイルを読み込み、Markdown形式とJSON形式に変換する基本的なコードをご紹介します。

import os
from mineru.pdf import PDFMiner
from mineru.schemas import OutputFormat

# 1. MinerUクライアントの初期化
# 多くの設定がありますが、基本はこのままでOK
miner = PDFMiner(
    # デフォルトではMarkdown形式で構造を保持
    output_format=OutputFormat.MARKDOWN_MULTI_MODAL
)

# 2. 解析したいPDFファイルのパスを指定
pdf_path = "specification.pdf"

# ※ 注意: このサンプルを実行するには、作業ディレクトリに 'specification.pdf' を配置してください。
if not os.path.exists(pdf_path):
    print(f"エラー: ファイル '{pdf_path}' が見つかりません。テスト用のPDFを配置してください。")
else:
    print(f"'{pdf_path}' の解析を開始します...")

    # 3. PDFの解析を実行
    # parse_pdfメソッドは、指定したフォーマット(ここではMarkdown)の文字列を返します。
    # 結果は MinerUResult オブジェクトとして返されます。
    result = miner.parse_pdf(pdf_path)

    # --- 結果の確認と保存 ---

    # 4. Markdown形式の出力を取得し、ファイルに保存
    markdown_content = result.get_content(OutputFormat.MARKDOWN_MULTI_MODAL)
    output_md_path = "output_spec.md"

    with open(output_md_path, "w", encoding="utf-8") as f:
        f.write(markdown_content)

    print("-" * 30)
    print(f"Markdown形式での抽出が完了しました。ファイル: {output_md_path}")
    print("\n--- 抽出されたMarkdownのプレビュー (最初の一部) ---")
    print(markdown_content[:500] + "...") # 最初の500文字を表示

    # 5. JSON形式の出力を取得(より構造化されたデータ向け)
    # JSON形式は、段落、表、数式などがオブジェクトとして格納され、プログラムで扱いやすいです。
    json_content = result.get_content(OutputFormat.JSON_READ_ORDER)
    output_json_path = "output_spec.json"

    with open(output_json_path, "w", encoding="utf-8") as f:
        f.write(json_content)
    
    print("-" * 30)
    print(f"JSON形式での抽出が完了しました。ファイル: {output_json_path}")
    print("\n--- 抽出されたJSONデータのプレビュー (最初の一部) ---")
    import json
    json_data = json.loads(json_content)
    # JSONデータの中身の構造を確認
    print(f"ルート要素のキー: {list(json_data.keys())}")
    if 'pages' in json_data and json_data['pages']:
        print(f"最初のページの要素数: {len(json_data['pages'][0]['elements'])}")
    print("...")

Markdownデータ(output_spec.md)
LLMのコンテキストウィンドウにそのまま入力し、要約、質問応答、特定の情報抽出を行う。 例: 「この仕様書に記載されているセキュリティ要件を3点抽出せよ」

JSONデータ(output_spec.json)
データをパースし、特定のセクション(例
表データ)をデータベースに格納したり、プログラム的に処理したりする。 例: JSON内のtype: 'table'のエントリを抽出し、pandas DataFrameに変換して分析する。


opendatalab/MinerU




ACL 2025発表の「Dolphin」がエンジニアにもたらす変革

おいおい、今日のバーベキュー、最高の肉が手に入ったぜ! あ、〇〇ちゃん、今日もお肉焼くの上手だね!「いやぁ、そんなことないっすよ。この網の熱を均一にする技術、まるでドキュメントのレイアウトを完璧に読み取るAIみたいじゃないですか!」え?なんだって?


AIの知性を飛躍させる「MemoriLabs/Memori」入門:記憶の保存と検索のアーキテクチャ

ご提示いただいたオープンソースの記憶エンジン「MemoriLabs/Memori」について、ソフトウェアエンジニアの視点から、その有用性、導入方法、そしてサンプルコードの例を、コントのお化け屋敷のように面白おかしく、しかし技術的に分かりやすく解説しますね!


daveebbelaar/ai-cookbookをゴルフ場に例える:AI開発への実践的アプローチ

daveebbelaar/ai-cookbookは、AIシステムを構築したいソフトウェアエンジニアにとって、まさに広大なゴルフ場のようなものです。多様なコース(例)が揃っている ゴルフ場にはショートホールからロングホールまで多様なコースがあるように、このリポジトリには画像認識、自然言語処理、データ分析など、様々なAIアプリケーションの「例」が揃っています。


【Python Robotics】ロボットアルゴリズムを動かす!エンジニアのための学習・開発入門

この AtsushiSakai/PythonRobotics は、ソフトウェアエンジニアのお兄ちゃんにとって、ロボティクスや自律移動に関する知識を深め、すぐに使えるサンプルコードが満載のとっても頼りになる教材集だよ!このリポジトリは、ただコードがあるだけじゃなくて、ロボットを動かすためのコアな技術を学べるのがポイントだよ。


激安で驚愕!動画で解説された最高の設計ノウハウが詰まったPythonコード集の「宝箱」

これは、有名な技術系YouTuberであるArjanCodesさんが、彼の動画で使用したPythonのコード例を全て集めたリポジトリなんです。まるで「動画で解説された最高の設計ノウハウが詰まった宝箱」みたいなものですよ!このリポジトリは、あなたのコーディングスキルと設計思想を劇的に向上させるための、実践的な学習ツールです。


AI捜査チームを結成せよ: openai-agents-pythonによるマルチエージェント連携の導入ガイド

やあ、諸君!私はAI捜査コンサルタントのGだ。今日の捜査対象は、openai/openai-agents-pythonという、複数のAIエージェントを束ねる軽量かつ強力なフレームワークだよ。このフレームワークの魅力は、まるで複数の優秀な探偵を雇い、複雑な事件を役割分担させて解決に導くことができる点にあるんだ。


オレオレ詐欺に注意...じゃない!GitHubDailyで良質な情報を安全に手に入れる方法

GitHubDaily/GitHubDaily は、その名の通り、GitHub上で見つけられた高品質で興味深い、実用的なオープンソースプロジェクトを毎日共有しているリポジトリです。新しいプログラミング言語、フレームワーク、開発ツール、面白い技術チュートリアルなど、多岐にわたるプロジェクトが紹介されています。


モダンなUIと強力なバックエンド。YTSageで始めるデスクトップアプリ開発

YTSage は、単なるダウンローダーではありません。その洗練されたUIと豊富な機能は、開発者の皆さんにとって、以下のような様々な形で役立つでしょう。YTSage のソースコードは、PySide6を使ったモダンなデスクトップアプリケーション開発の生きたサンプルです。UIの設計、ウィジェットの配置、イベントハンドリングなど、実践的な知識を楽しみながら学ぶことができます。特に、QTreeView を使ったファイル構造の表示や、QProgressBar を使ったダウンロード進捗の可視化など、具体的な実装例が豊富に含まれています。


Big Techも注目のAIパワーをセキュリティに。PentestGPTで効率化する侵入テストの最前線

今回は、サイバーセキュリティの分野で非常に注目されている、LLM(大規模言語法モデル)をペネトレーションテスト(侵入テスト)に活用したツール「PentestGPT」について解説します。Big Tech(Apple, Google, Amazonなど)が提供する最先端のAI技術を、実際の現場でどう「武器」として使うか、という視点でお話ししますね。