Kachakacha

画像から文字を抽出

またはここにドロップ · 貼り付けは Ctrl+V

写真やスクリーンショットの中の文字をテキストとして取り出します。日本語と英語を一緒に読み、行ごとに信頼度を表示します。

使い方

  1. 文字の入った画像をアップロードします。複数枚でも構いません。
  2. 言語を選びます。英字のない文書なら「日本語のみ」のほうが誤認識が減ります。
  3. 「文字を読む」を押します。初回だけ認識モデルの取得に数秒余分にかかります。
  4. 結果をコピーするか.txtで保存します。薄く表示された行は信頼度が低いので確認してください。

画像はサーバーへ送られますか?

送られません。認識エンジンと言語データをブラウザに取り込み、この端末の中だけで処理します。名刺・身分証・契約書のように人に見せたくない画像もそのまま扱えます。

最初だけ時間がかかるのはなぜですか?

エンジン(約2.7MB)と言語データを初回に一度だけ取得するからです。以降はブラウザのキャッシュに残り、すぐに始まります。

手書きも読めますか?

ほとんど読めません。このエンジンは印刷された文字を前提に学習しているため、手書きの精度は大きく落ちます。印刷物・スクリーンショット・看板のような活字に使ってください。

精度を上げるには?

文字が大きく鮮明なほど効きます。傾いた写真は先に切り抜きツールでまっすぐにしてください。解像度が低すぎる場合は拡大するより撮り直すほうが確実です。文書に実際に含まれる言語だけに絞るのも効果があります。

「日本語のみ」が常に正確ですか?

いいえ。日本語だけの文書では有利ですが、英字が混じった瞬間に不利になります。同じ画像で試すと、混在設定はメールアドレスを正しく読む代わりに一部の日本語を取り違え、日本語のみの設定はその逆になりました。文書の中身に合わせて選んでください。

表や書式は保たれますか?

保たれません。取り出すのは行単位のテキストだけです。表の構造や書体・色は引き継がれません。

PDFからも文字を取り出せますか?

PDFをアップロードすると1ページ目を画像に変換して読みます。元から文字が入っているPDFなら、PDFビューアーから直接コピーするほうが正確です。OCRは文字が絵として入っているスキャン文書のためのものです。