写真やスクリーンショットの中の文字をテキストとして取り出します。日本語と英語を一緒に読み、行ごとに信頼度を表示します。
使い方
- 文字の入った画像をアップロードします。複数枚でも構いません。
- 言語を選びます。英字のない文書なら「日本語のみ」のほうが誤認識が減ります。
- 「文字を読む」を押します。初回だけ認識モデルの取得に数秒余分にかかります。
- 結果をコピーするか.txtで保存します。薄く表示された行は信頼度が低いので確認してください。
画像はサーバーへ送られますか?
送られません。認識エンジンと言語データをブラウザに取り込み、この端末の中だけで処理します。名刺・身分証・契約書のように人に見せたくない画像もそのまま扱えます。
最初だけ時間がかかるのはなぜですか?
エンジン(約2.7MB)と言語データを初回に一度だけ取得するからです。以降はブラウザのキャッシュに残り、すぐに始まります。
手書きも読めますか?
ほとんど読めません。このエンジンは印刷された文字を前提に学習しているため、手書きの精度は大きく落ちます。印刷物・スクリーンショット・看板のような活字に使ってください。
精度を上げるには?
文字が大きく鮮明なほど効きます。傾いた写真は先に切り抜きツールでまっすぐにしてください。解像度が低すぎる場合は拡大するより撮り直すほうが確実です。文書に実際に含まれる言語だけに絞るのも効果があります。
「日本語のみ」が常に正確ですか?
いいえ。日本語だけの文書では有利ですが、英字が混じった瞬間に不利になります。同じ画像で試すと、混在設定はメールアドレスを正しく読む代わりに一部の日本語を取り違え、日本語のみの設定はその逆になりました。文書の中身に合わせて選んでください。
表や書式は保たれますか?
保たれません。取り出すのは行単位のテキストだけです。表の構造や書体・色は引き継がれません。
PDFからも文字を取り出せますか?
PDFをアップロードすると1ページ目を画像に変換して読みます。元から文字が入っているPDFなら、PDFビューアーから直接コピーするほうが正確です。OCRは文字が絵として入っているスキャン文書のためのものです。