ロゴ
ToolkitsLabEfficiency Hub
PR広告を含む

PDF→Markdown変換ツール(AIに読ませる資料整形)見出し・箇条書き・表を保ったままMarkdown化、トークン数表示・自動分割

PDFをドラッグするだけで、見出し・箇条書き・表の構造を保ったままMarkdownに変換します。 段組みで崩れた改行やヘッダー・フッターの繰り返しも自動補正し、AIにそのまま渡せる形に整えます。

入力内容は外部に送信されません。

詳しく

PDFをここにドラッグ&ドロップ

または

PDFをAIに読ませる前にMarkdown化する理由|構造を残して渡す

論文やマニュアルのPDFをそのままChatGPTやClaudeにコピー&ペーストすると、見出しと本文の区別がなくなり、段組みレイアウトのせいで文章の途中に関係ない改行が差し込まれることがよくあります。AIはこの崩れた文章から「どこが見出しでどこが本文か」を推測するしかなく、要約や質問への回答の精度が落ちてしまいます。

本ツールは、PDFに埋め込まれた文字のフォントサイズ・位置情報を解析し、見出し・箇条書き・表といった構造を判別したうえでMarkdown形式に変換します。2段組みレイアウトで発生しがちな読み順の崩れやハイフネーション(単語の途中での改行)も自動で補正します。

変換と同時に推定トークン数を算出し、長い資料は段落のまとまりを保ったまま読みやすい単位に自動分割できます。あとはMarkdownをコピーして、AIのチャット欄に貼り付けるだけです。

こんなシーンで便利です

論文PDFをAIに要約・翻訳してもらいたい時に

英語論文などのPDFを見出し構造を保ったままMarkdown化し、「Introductionだけ要約して」「この表の数値を日本語で説明して」といった依頼がしやすくなります。

製品マニュアル・仕様書をAIに質問しながら読みたい時に

操作マニュアルや仕様書のPDFをテキスト化し、AIに「この設定項目の意味を教えて」「手順を簡潔にまとめて」と聞きながら読み進められます。

2段組みのPDFで改行がぐちゃぐちゃになって困っている時に

学会誌や雑誌形式の2段組みPDFは、単純なコピペだと文章の途中に無関係な改行が入りがちです。読み順を補正したうえでMarkdown化します。

資料が長く、AIのトークン上限に収まるか不安な時に

変換後の推定トークン数を見ながら、収まらなそうであれば段落のまとまりを保った単位に自動分割。章ごとに順番にAIへ渡す作業がしやすくなります。

使い方は簡単 4ステップ

  1. PDFファイルをドラッグ&ドロップするか、「ファイルを選択」ボタンから変換したいPDFを指定します。
  2. 必要に応じて、変換するページ範囲やヘッダー・フッターの自動除去、表の変換などの設定を調整します。
  3. 「Markdownに変換する」ボタンを押すと、見出し・箇条書き・表の構造を保ったテキストが生成されます。
  4. 推定トークン数を確認し、長い場合は「分割する」を使って読みやすい単位に分け、コピーまたは.mdファイルとしてダウンロードします。

※すべての解析・変換処理はブラウザ内で完結し、アップロードしたPDFの内容が外部サーバーへ送信されることはありません。

ご利用時の注意点

  • 本ツールはPDFに埋め込まれたテキスト情報を抽出する仕組みのため、紙をスキャンしただけの画像のみのPDF(文字が選択できないもの)からは文字を抽出できません。
  • 複雑な表組みや罫線のないレイアウト、図版中の文字などは、完全に意図通りのMarkdown構造に変換されない場合があります。変換後に内容をご確認ください。
  • 表示される推定トークン数はあくまで概算の目安です。実際のトークン数は利用するAIモデルのトークナイザーによって前後します。
  • ファイルサイズやページ数が非常に大きいPDFでは、解析・変換にかかる時間がブラウザの性能に依存して長くなる場合があります。

主要AIモデルのコンテキストウィンドウ(最大入力トークン数)目安表

変換後の推定トークン数と見比べるための目安です。実際の上限はモデルのバージョンやプランによって変動するため、必ず利用先の最新情報もあわせてご確認ください。

AIモデル(系統)コンテキストウィンドウの目安日本語の文字数換算の目安
GPT-4o / GPT-4.1 mini系約12.8万トークン約15万〜19万文字
GPT-4.1 / GPT-4.1 系(長文対応)約100万トークン約120万〜150万文字
Claude(Opus・Sonnet・Haiku)約20万トークン約24万〜30万文字
Gemini 1.5 Flash約100万トークン約120万〜150万文字
Gemini 1.5 Pro約200万トークン約240万〜300万文字

【論文・専門資料は日本語訳や注釈でトークン消費が増えやすい】
原文が英語であっても、AIに「日本語で要約して」と依頼すると出力側のトークンが増えます。入力側の目安だけでなく、やり取りを重ねる前提で余裕を持ったページ範囲・分割単位を選ぶことをおすすめします。

※上表は一般的な目安であり、各AIサービスの料金プランや提供時期によってコンテキストウィンドウの上限は変動します。正式な上限は利用するサービスの公式情報をご確認ください。

PDFの構造をAIに正しく伝えるために知っておきたいこと

PDFをテキスト化してAIに渡す際に押さえておきたい、改行崩れ・表・スキャンPDFの考え方を解説します。

結論:PDFの改行崩れは「段組みレイアウト」が原因

PDFは紙面の見た目を再現するファイル形式のため、実際の文章の内部データには「どの文字がどの段(カラム)に属するか」という情報がなく、座標だけが記録されています。
単純にPDFから文字をそのまま抜き出すと、左の段を読み終わる前に右の段の文字が混ざってしまい、文章の途中に無関係な改行が差し込まれたような状態になります。
本ツールは文字の横位置(x座標)のまとまりを段として認識し、段ごとに上から下へ読んでから次の段に進むよう並べ替えることで、この崩れを補正します。

見出しはどうやって判定されているのか

本ツールは、ページ内の文字のフォントサイズの分布を解析し、本文としてもっとも多く使われているサイズを基準に、それより明確に大きい文字を見出し候補として扱います。
フォントサイズの差が大きいほど上位の見出し(#や##)として扱われ、本文とほぼ同じサイズの強調文字(太字など)は見出しと誤認しないよう調整しています。
デザイン性の高い資料や、見出しに装飾フォントを使っている資料では、判定がずれる場合がある点にご留意ください。

表(テーブル)の変換には限界がある

Markdownの表は本来シンプルな行・列構造を前提とした記法です。PDF内の表は、セル結合や罫線なしのレイアウト、改行を含むセルなど、Markdownでは表現しきれない複雑な構造を持つことが多くあります。
本ツールは文字の列位置から表らしき行の並びを検出して変換しますが、完全な再現を保証するものではありません。重要な表は、変換後にプレビューで数値や項目のズレがないか必ず確認してください。

スキャンPDF(画像のみ)はテキスト抽出の対象外

紙の書類をスキャナーやカメラで撮影しただけのPDFは、見た目は文字でも実体は1枚の画像データであり、PDF内部にテキスト情報を持ちません。
本ツールはPDFに埋め込まれた文字情報を読み取る仕組みのため、このような画像のみのPDFからは文字を抽出できず、変換後に空の結果となります。
スキャンした資料をAIに読ませたい場合は、先にOCR(光学文字認識)機能を備えた別のツールで文字起こしをしてから、本ツールで構造整形をかける2段階の手順がおすすめです。

よくある失敗と対策

2段組みのPDFをそのままコピペし、文章の順序がめちゃくちゃになる

学会誌や雑誌レイアウトのPDFから直接テキストを選択してコピーした結果、左右の段の文章が1行ごとに入り混じってしまい、AIに渡しても意味が通らない文章になってしまう失敗です。

💡 対策・解決策を見る▼
本ツールで変換すると、段ごとにまとまった順序でテキスト化されます。変換後のプレビューで段落の意味が通っているかを確認し、崩れている場合はページ範囲を絞って再変換してみてください。

ヘッダー・フッターの文言が本文に混ざり、AIが文脈を誤読する

各ページの上部・下部に繰り返されるタイトルやページ番号がそのまま本文に挟み込まれてしまい、AIが「このタイトルも本文の一部」と誤認して要約や回答がずれてしまう失敗です。

💡 対策・解決策を見る▼
「ヘッダー・フッターの自動除去」をオンにして変換すると、複数ページで繰り返される行が検出・除去されます。誤って必要な文章まで消えた場合は、オフにして手動で該当行を調整してください。

スキャンした画像PDFを変換しても、文字が1文字も抽出されない

紙の資料をスキャンしただけの画像ベースのPDFをそのままアップロードし、変換結果が空になってしまい、ツールが壊れていると誤解してしまうケースです。

💡 対策・解決策を見る▼
画像のみのPDFは文字情報を持たないため、本ツールでは抽出できません。別途OCR対応のツールで文字起こしをしてから、改めて本ツールで構造整形をかけてください。

単語の途中で改行されたハイフネーションがそのまま残り、誤字に見える

英語論文などで行末の単語が「inter-」「national」のように分割されたまま変換され、AIが単語を正しく認識できず、誤字として処理されたり翻訳が不自然になったりする失敗です。

💡 対策・解決策を見る▼
本ツールはハイフネーションの補正機能で、行末のハイフンと次の行の単語を自動的に結合します。専門用語や固有名詞で結合がおかしい場合は、プレビューで該当箇所を手動修正してください。

長い資料を分割せずに貼り付け、AIの回答が途中で途切れる

変換したテキストが長大なまま一度にAIへ貼り付けてしまい、コンテキストウィンドウの上限を超えて入力が拒否されたり、AIの回答が尻切れになってしまう失敗です。

💡 対策・解決策を見る▼
変換後に表示される推定トークン数を確認し、利用するAIモデルの上限に近い場合は「分割する」機能で段落のまとまりを保った単位に分け、章ごとに順番に貼り付けて会話を進めましょう。

よくある質問(FAQ)

Q.2段組み(2カラム)のPDFでも正しく変換できますか

Q.

A. 本ツールは文字の座標情報をもとに行の並び順を判定し、2段組みレイアウトで発生しがちな「左右の段が混ざって読み順がおかしくなる」「段の途中で改行が入ってしまう」といった崩れを自動で補正します。ただし非常に複雑なレイアウト(3段組み以上や図表を挟んだ段組み)では、完全に意図通りの順序にならない場合があります。変換後のプレビューで読み順に違和感がないか確認することをおすすめします。

Q.PDF内の表(テーブル)はどのように変換されますか

Q.

A. 行内の文字の横位置(列の区切り)を解析し、複数行にわたって同じ列構成が続く箇所をMarkdownの表形式(| 列 | 列 |)に変換します。罫線のない表や、セル内で文章が折り返されている複雑な表では、列の判定がずれることがあります。変換後に表の崩れを見つけた場合は、プレビュー画面で手動修正してからご利用ください。

Q.スキャンした画像だけのPDF(文字が選択できないPDF)も変換できますか

Q.

A. 本ツールはPDF内に埋め込まれた「テキスト情報」を抽出する仕組みのため、紙の書類をスキャンしただけの画像のみのPDF(文字が選択・コピーできないもの)からは文字を抽出できません。変換を実行すると文字が検出できなかった旨を表示しますので、その場合は別途OCR(文字認識)対応のツールをご利用ください。

Q.変換後に表示されるトークン数は何に使いますか

Q.

A. ChatGPTやClaudeなどのAIには、一度に読み込める文章量の上限(コンテキストウィンドウ)があります。変換後の推定トークン数を確認することで、そのままAIに貼り付けて問題ないか、分割して渡す必要があるかを事前に判断できます。上限を超えそうな場合は「分割する」機能で、段落の区切りを保ったまま読みやすい単位に自動分割できます。

Q.各ページの上下に繰り返される社名やページ番号は自動で消えますか

Q.

A. はい。複数ページにわたって同じ文言が繰り返し出現する行(ヘッダー・フッターによくある社名、資料タイトル、「Page 1 of 10」のようなページ番号表記など)を自動的に検出し、本文から除去するオプションを用意しています。誤って本文の一部まで除去されてしまう場合は、この機能をオフにして手動で調整してください。

Q.アップロードしたPDFの内容が外部に送信される心配はありませんか

Q.

A. 一切ありません。本ツールはPDFの解析・Markdown変換の処理をすべてブラウザ内だけで実行する設計です。アップロードしたPDFファイルや抽出したテキストが外部サーバーへ送信されることはなく、ページを閉じれば内容は即座に消去されます。

Q.変換結果はどのような形式で保存・コピーできますか

Q.

A. 画面上の「コピー」ボタンでMarkdown形式のテキストをクリップボードにコピーできるほか、「.mdファイルとしてダウンロード」でそのままファイル保存も可能です。分割した場合は、チャンク(分割後の各ブロック)ごとに個別のコピー・ダウンロードができるため、AIのチャットに1つずつ順番に貼り付ける作業がしやすくなっています。

User Feedback & Request

あなたの声で、
このツールをより鋭く。

「こんな機能が欲しい」「ここを直してほしい」といったご意見や、新しいツールのリクエストを募集しています。エンジニアが直接目を通し、開発の参考にさせていただきます。

フィードバックを送る