PDFの壁を打ち破る:数式・表・多段組対応のデータ抽出ツール MinerUの威力


PDFの壁を打ち破る:数式・表・多段組対応のデータ抽出ツール MinerUの威力

opendatalab/MinerU

2025-10-14

ホテルのコンシェルジュのように、このツールをどのように活用できるか、導入方法、そしてサンプルコードまで、分かりやすく丁寧にご案内しますね。

MinerUは、一言でいうと「複雑なPDFなどの非構造化データを、大規模言語モデル(LLM)がすぐに使える、構造化されたデータ(MarkdownやJSON)に魔法のように変換してくれる」Pythonライブラリです。

PDFは、論文、契約書、技術仕様書、報告書など、重要な情報源でありながら、データとして扱うには非常に手間がかかります。従来のPDFパースは、レイアウトが崩れたり、表や数式が文字化けしたりと、苦労が絶えませんでした。

MinerUは、この「PDFからのデータ抽出と前処理の苦痛」を解消してくれます。

課題(Before MinerU)メリット(After MinerU)
データ前処理の地獄: PDFから手作業でコピペ、または複雑な正規表現やカスタムスクリプトで抽出。LLM-Readyなデータ: 高精度で構造を保ったMarkdownやJSONを自動生成。前処理時間が激減。
レイアウトの複雑さ: 多段組、ヘッダー/フッター、脚注が混在し、テキストがバラバラになる。正確な読み順の確保: 人間が読む自然な順序でテキストを再構成。エージェント(Agentic Workflow)の入力として最適。
非構造化データの壁: 表や数式をデータ化するのが困難。OCRが必要な場合もある。リッチなデータ抽出: 表をHTMLに、数式を$\LaTeX$に変換してくれます。スキャンPDFのOCRも自動で対応。
エージェント開発のボトルネック: 信頼性の低いPDF抽出結果が、エージェントの意思決定を歪ませる。信頼性の高い入力: クリーンで構造化されたデータにより、エージェントの処理精度と信頼性が向上。

MinerUはPythonで提供されています。セットアップは非常にシンプルです。

Python 3.8以上が必要です。仮想環境(venvcondaなど)での作業を強くお勧めします。

pipを使って簡単にインストールできます。

# ターミナルで実行
pip install mineru

OCR機能など、特定の機能を利用する場合は、追加の依存関係をインストールすることが推奨されています。

# 拡張機能を使いたい場合はこちら
# 詳細な要件は公式のGitHubリポジトリをご確認ください。
# 例: pip install mineru[ocr, all] など

ここでは、PDFファイルを読み込み、Markdown形式とJSON形式に変換する基本的なコードをご紹介します。

import os
from mineru.pdf import PDFMiner
from mineru.schemas import OutputFormat

# 1. MinerUクライアントの初期化
# 多くの設定がありますが、基本はこのままでOK
miner = PDFMiner(
    # デフォルトではMarkdown形式で構造を保持
    output_format=OutputFormat.MARKDOWN_MULTI_MODAL
)

# 2. 解析したいPDFファイルのパスを指定
pdf_path = "specification.pdf"

# ※ 注意: このサンプルを実行するには、作業ディレクトリに 'specification.pdf' を配置してください。
if not os.path.exists(pdf_path):
    print(f"エラー: ファイル '{pdf_path}' が見つかりません。テスト用のPDFを配置してください。")
else:
    print(f"'{pdf_path}' の解析を開始します...")

    # 3. PDFの解析を実行
    # parse_pdfメソッドは、指定したフォーマット(ここではMarkdown)の文字列を返します。
    # 結果は MinerUResult オブジェクトとして返されます。
    result = miner.parse_pdf(pdf_path)

    # --- 結果の確認と保存 ---

    # 4. Markdown形式の出力を取得し、ファイルに保存
    markdown_content = result.get_content(OutputFormat.MARKDOWN_MULTI_MODAL)
    output_md_path = "output_spec.md"

    with open(output_md_path, "w", encoding="utf-8") as f:
        f.write(markdown_content)

    print("-" * 30)
    print(f"Markdown形式での抽出が完了しました。ファイル: {output_md_path}")
    print("\n--- 抽出されたMarkdownのプレビュー (最初の一部) ---")
    print(markdown_content[:500] + "...") # 最初の500文字を表示

    # 5. JSON形式の出力を取得(より構造化されたデータ向け)
    # JSON形式は、段落、表、数式などがオブジェクトとして格納され、プログラムで扱いやすいです。
    json_content = result.get_content(OutputFormat.JSON_READ_ORDER)
    output_json_path = "output_spec.json"

    with open(output_json_path, "w", encoding="utf-8") as f:
        f.write(json_content)
    
    print("-" * 30)
    print(f"JSON形式での抽出が完了しました。ファイル: {output_json_path}")
    print("\n--- 抽出されたJSONデータのプレビュー (最初の一部) ---")
    import json
    json_data = json.loads(json_content)
    # JSONデータの中身の構造を確認
    print(f"ルート要素のキー: {list(json_data.keys())}")
    if 'pages' in json_data and json_data['pages']:
        print(f"最初のページの要素数: {len(json_data['pages'][0]['elements'])}")
    print("...")

Markdownデータ(output_spec.md
LLMのコンテキストウィンドウにそのまま入力し、要約、質問応答、特定の情報抽出を行う。 例: 「この仕様書に記載されているセキュリティ要件を3点抽出せよ」

JSONデータ(output_spec.json
データをパースし、特定のセクション(例
表データ)をデータベースに格納したり、プログラム的に処理したりする。 例: JSON内のtype: 'table'のエントリを抽出し、pandas DataFrameに変換して分析する。


opendatalab/MinerU




ACL 2025発表の「Dolphin」がエンジニアにもたらす変革

おいおい、今日のバーベキュー、最高の肉が手に入ったぜ! あ、〇〇ちゃん、今日もお肉焼くの上手だね!「いやぁ、そんなことないっすよ。この網の熱を均一にする技術、まるでドキュメントのレイアウトを完璧に読み取るAIみたいじゃないですか!」え?なんだって?


ディフュージョンモデルGUI「ComfyUI」:魔法の呪文で画像を創る!

ComfyUIは、まるで魔法少女が魔法のアイテムを使って呪文を唱えるように、画像を生成するAIモデル「Diffusion Model」を直感的に操作できるグラフィカルユーザーインターフェース(GUI)です。通常の画像生成AIは、呪文(プロンプト)を入力するだけでもすごいのですが、ComfyUIを使うと、まるで魔法の回路図を描くように、様々な処理を組み合わせてもっと複雑で美しい画像を、まるで自分の手で描いたかのように作れてしまうんです!


電波の届かない場所でも安心!魔法少女のための音楽ダウンロード術

今回のミッションは、そんな寂しい気持ちを吹き飛ばす、素敵な魔法アイテムのお話よ!みんな、お気に入りのアニメやゲームの主題歌ってあるでしょう?CDショップに探しに行っても、なかなか見つからなかったり、全部揃えるのが大変だったりするわよね。そんなとき、私たちの秘密兵器「Spotify-downloader」の出番よ!これは、魔法の呪文を唱えるだけで、Spotifyにある音楽を、YouTubeから探してきて、宝石みたいに輝くMP3ファイルとして手に入れられる、とっても便利な魔法の道具なの。


仮想通貨ボットの最前線!Hummingbotで始めるアルゴリズム取引入門

まずは、Hummingbotがどんなもんなのか、ざっくり説明しとくわな。Hummingbotいうのはな、仮想通貨の自動売買ボットを作るためのオープンソースソフトウェアのことどす。しかも、普通の自動売買と違ごうて、高頻度取引(High-Frequency Trading、HFT)にも対応できるように設計されとるんや。Pythonで書かれとって、Dockerも使えるから、環境構築も比較的楽にできるのがええところやね。


Big Techも注目のAIパワーをセキュリティに。PentestGPTで効率化する侵入テストの最前線

今回は、サイバーセキュリティの分野で非常に注目されている、LLM(大規模言語法モデル)をペネトレーションテスト(侵入テスト)に活用したツール「PentestGPT」について解説します。Big Tech(Apple, Google, Amazonなど)が提供する最先端のAI技術を、実際の現場でどう「武器」として使うか、という視点でお話ししますね。


動画ファイルが賢くなる?NLPとOpenCVでテキスト検索を可能にする「memvid」とは

「memvid」は、Olow304/memvid というGitHubリポジトリで公開されている、Pythonで書かれたライブラリです。NLP(自然言語処理)とOpenCV(コンピュータービジョンライブラリ)を組み合わせて、テキスト情報を動画ファイル(MP4)の中に効率的に保存し、高速な意味検索を可能にします。


ソフトウェア開発を加速するDocsGPT:ハルシネーション回避で信頼度UP

DocsGPTは、あなたの持つドキュメントや知識ベースから、信頼性の高い情報を引き出すためのオープンソースツールです。よくある生成AIの課題である「ハルシネーション(AIが事実ではない情報を生成すること)」を避け、プライベートな情報源から正確な答えを導き出すことに特化しています。


ソフトウェアエンジニアのためのtheHarvester入門: セキュリティとOSINT活用法

今日はlaramies/theHarvesterについて、ソフトウェアエンジニアの皆さんに役立つ情報をお届けしますね!theHarvesterは、まるで雲の中から雨粒を探すように、インターネットの広大な情報の中から、メールアドレスやサブドメインといった貴重な情報を収集してくれる、とっても賢いツールなんです


【エンジニア向け】RAGの常識を覆す!ストレージ97%削減のプライベート検索技術「LEANN」徹底解説

こんにちは!未来の技術を形にするソフトウェアエンジニアの皆さん、お疲れ様です。今回ご紹介するのは、まるで「どこでもドア」のように、皆さんの開発環境に革命をもたらすかもしれない、すごい道具(ライブラリ)、「LEANN」です。yichuan-wさんが開発されたこのライブラリは、皆さんが今注目している「RAG (Retrieval-Augmented Generation / 検索拡張生成)」という技術を、速く、正確に、そして何よりもプライベートに、個人のデバイスで実現するための画期的なアプローチを提供します。


あなたのサービス品質向上に貢献:qeeqbox/social-analyzer導入とAPI連携の具体例

このツールは、指定されたユーザー名が、1000以上のソーシャルメディアやウェブサイトで利用されているかどうかを、効率的かつ広範囲にわたって調査・分析するためのものです。Node. js、JavaScript、Pythonに対応しており、API、CLI(コマンドラインインターフェース)、そしてウェブアプリとして利用できます。