【OCR不可】言語学徒が…レア本解読で挑むAIの限界に出会った

2026年8月24日
卯香香 ボッチ学生
卯香香
総合 25 3,305pt

言語学をやっています。大学生です。

Amazonのアソシエイトとしてガジェッターは適格販売により収入を得ています
BLOG

ブログ日記/その他

サムネイル画像の変換はこちらのサイトを使用しました。
サムネイル画像の変換はこちらのサイトを使用しました。

 みなさん,こんばんは。ガジェッター復旧しましたね。のぞこうと思ったらアクセスできなくなってて驚きました。なんかみなさんクレーン車みたいな画像でしたが,私のはこれだったんですよね。英弱すぎて読めないんですけど,多分利用不可的なお知らせ画面だと思います。

503って初めて見た
503って初めて見た

 今日は小ネタです,というのも今日の困りごとについてちょっと試行錯誤した結果と相談ですかね。雑談です。今日の話題はOCRですね。Optical Character Recognition,光学文字認識なんて言われたりするやつです。

モンゴル文字

 画像から文字をコピペするの,すごく楽になりましたよね。いつの間にかスマホの写真アプリは基本的にどれもできるようになりました。ですが,今日はモンゴル文字のお話です。まぁ,具体的な文字について詳細はわかんないので,指導教員の本でも貼っておきます。関心があれば。

 モンゴル文字とか,蒙古文字なんて呼ばれる文字です。系譜としてはウイグル文字からの派生ですね。

 もちろん私は読めません。というのも,統語論をやっていて,基本的に論文はこれで書かれていません。モンゴル文字が横書きに非対応ってのが大きいのでしょうか。基本的には転写と言われるローマ字ベースのアルファベットが使われます。そしてもちろん,それを読むこともできません,グロスと呼ばれる説明書きみたいなのを下につけるのがルールなんですよね。だから,モンゴル語の研究をしていても,モンゴル語が読めるわけではない...っていったら指導教員に怒られますかね。まぁ,私は読めません。

こんな感じ。グロシみたいでちょっと面白い。
こんな感じ。グロシみたいでちょっと面白い。

 ちなみにモンゴルでは,ソ連邦の影響からキリル文字を使う機会も多いようです。まぁ,学校では両方教えているようで。

OCRしたい!

 基本的に,OCRの精度ってすごいですよね。今時,英語で書かれた論文でも,写真なりかこって検索なりですぐ日本語で解説してもらえます。でもOCRって言語によっては現在でも難易度が高いものはまだまだたくさんあります。例えば,中世のギリシア文字や,日本語のくずし字(昔の絵の縁の方にあるうねうねっとしたような文字),アラビア語・ペルシア語といった連記体の含まれる文字です。

www.itmedia.co.jp
リンクカード
www.itmedia.co.jp

 ロシアの筆記体の難解さも似たようなものです。

maidonanews.jp
リンクカード
maidonanews.jp

 ですが,時代はAI全盛期,最初期のOCRが不可だった頃とは違い,今のAI基本的にどれもデフォルトでOCRができます。そこで,今日はAIを使ってOCRに挑戦しよう,そういう話です。

対象の本

book.kongfz.com
リンクカード
book.kongfz.com
book.kongfz.com
リンクカード
book.kongfz.com

 対象はこれ。検索しても基本的には出てこない,日本国内の図書館に確認した限りでは所蔵のないレア本。内容は当然著作権的に見せられませんが,モンゴル語の馬のことわざに関する本で,モンゴル語文字の横に中国語訳が書いてある感じです。当然縦書き,OCRの敵を寄せ集めたかのような本です。

DeepSeek

 はい,まずはお馴染みクジラさん。OCRといえばこれですよね。少し前まで私の相棒でした。

www.deepseek.com
リンクカード
www.deepseek.com
左のが快速モード,真ん中が専門家,右は画像認識機能(これはあんまり使えない)
左のが快速モード,真ん中が専門家,右は画像認識機能(これはあんまり使えない)

  DeepSeekには快速モードと専門家モードがあります。画像やファイルのアップロードは快速モードしか対応してません,ちょっと残念ですね。DeepSeekでまず試してみました。プロンプトはこんな感じ。

添付の書籍について,モンゴル語の本文と,その中国語訳がついた本の一部です。これを,OCRしましょう。ただし,モンゴル文字のままでは,データとして使いにくいので,これをこんなふうにして欲しいのです。 (例) (1) Ulaɣan-ø Baɣatur-i maɣta-jai. Ulagan-Nom Bagatur-Acc praise-Past ‘Ulagan praised Bagatur.’ この形式で,全てのデータを抽出してください。

 この結果,推論の途中に「意味のある中国語のことわざがほとんどなく、ほとんどが数字、空白、またはノイズです。これらはスキップします」なんて書かれて,結局データは抽出してもらえませんでした。また,モンゴル文字もアラビア語と誤解しているのか,正しく認識してもらえませんでした。

Qwen 3.8 Max 

 次に,今の私の親友のQwenくんです。

qwen.ai
リンクカード
qwen.ai
3.7 Plusで試しても同様だった。それ以下のバージョンの方が強いはずないので,試してません。
3.7 Plusで試しても同様だった。それ以下のバージョンの方が強いはずないので,試してません。

 Qwen推しなので,Qwenでできました!Qwenを使いましょう!って記事を書ければ良かったのですが,Qwenくんの回答は「提供されたテキストの多くが モンゴル文字の OCR 失敗・文字化け・フォント依存コードの誤抽出 によって、原文を復元できない状態になっている」でした。やっぱ本体の性能と,OCRの性能は別なのでしょうか。残念です。

Gemini 

 当然ケチケチなので,Geminiは課金してません。Geminiは画像生成で使うくらいでしょうか。画像生成に関してはQwenくん,コツが多くいるので,簡単にいうこと聞いてくれるGeminiの勝ちです。

gemini.google.com
リンクカード
gemini.google.com

 結論から,Geminiくんはまず指示を聞いてくれません。なんか本の書籍情報出してきたり,なんかウェブ検索してズルしようとしてきます。OCR以前の問題ですね。Geminiにいうことを聞かせるコツでもあるのでしょうか。

Chat GPT 5.6 Deep think(Copilot版)

 ガジェッターを破壊したChatGPTくんです。実を言えば,この中で一番まともにやってくれたのはChat GPTくんでした。まぁ,途中までちょくちょくミスも混ざりながら奮闘はしてくれました。でもやっぱりモンゴル語は無理でしたね,中国語の成功率も体感半分以下といった感じ。意外と難しいみたいで。

どうして失敗したの?何をしたの?って詰めたら答えてくれた。ごめんねChatGPT
どうして失敗したの?何をしたの?って詰めたら答えてくれた。ごめんねChatGPT

 あと,まぁ豆包もありますが,あれは試すまでもなくエンタメAIなので省略。

助けてください

 はい,以上で,現状あるAIサービスほとんどためしました,まぁ,わかりますよ,API取得してなんだかんだですよね,でも普通に料金が高いです。母語話者による手打ちが早いなんていえばそれまでなのでしょうけど,まぁ,それは元も子もないというか。

 吉田さんがClaudeをお勧めしていらっしゃいました。結構お勧めされるんですよね,現状最強なのだとか。まぁ,高いんですけど。Claude,OCR技術どうなんですかね。気になるところです。

gadgeteer.jp
リンクカード
gadgeteer.jp
Gadgeteer for Macintosh
SUMMARY

まとめ

OCRはやっぱりまだまだ難しい

PR

関連商品

Facebook LINE B! はてな RSS
LIKE

いいね (3件)&足跡 (2件)

TALK

コメント (1件)

ひろき
ひろき 2時間前
ClaudeさんタダでもOCRぐらいならできると思いますよ〜
試してはいかがでしょうか?
NEXT

前後の記事

MORE

関連レビュー

コメ欄 1 3