下書きのプレビューです(公開されていません)プレビューを終える

2026年9月12日

RAGの精度が上がらないとき、検索の設定より先に確かめること|資料は元のまま入っている?

RAGの精度が上がらないとき、検索の設定より先に確かめること|資料は元のまま入っている?

AIに手伝ってもらって、自社の資料をAIが参照して答える仕組みを作った。

Claude Code のようなAIに頼んで、データベース(資料を入れておく保管庫)ごと作ってもらった人もいれば、Dify や NotebookLM のような道具に資料を入れた人もいます。どれで作っていても、この記事でやることは同じです。

入れたものは似ています。マニュアル、過去の提案書、打ち合わせの文字起こし、自分で書いた記事。

作った直後は「すごい」と思ったはずです。聞けば、うちの資料をもとにAIが答えてくれる。

ところが、使っているうちに引っかかりが出てきます。

  • 答えが薄い
  • 資料に書いてあるはずのことが、出てこない
  • 言い回しが、どこかで読んだような一般論になる

「うちの資料を読んで答えて」と頼んでいるのに、答えがうちの資料らしくない。

そこで「RAG 精度」「RAG 精度向上」と調べた方に向けて、この記事を書いています。

RAG(ラグ)は、AIが答える前に、入れておいた資料の中から関係する部分を探し、それを見ながら答える仕組みのことです。自社の資料を参照して答える仕組みは、ふつうこう呼ばれます。

Googleの予測候補を見ると、このまわりには「rag チャンクサイズ」「rag データ 前処理」「rag 検索精度向上」といった言葉が並びます。チャンクは、資料を探しやすいように小分けにした、ひと切れのこと。前処理は、入れる前に資料を整えることです。

どれも、入っている資料をどう切って、どう探すかを直すための言葉です。

RAGの精度を上げる前に、何を確かめればいいの?

この記事の答えは、その手前にあります。

検索の設定を直す前に、入れた資料が元のまま入っているかを、文字数で確かめてください。

切り方や探し方の工夫は、資料がちゃんと入っていて、はじめて効きます。入っていない一文は、探し方をどう直しても出てきません。

確かめ方は単純です。元の資料の文字数と、入っている本文の文字数を、同じ数え方で数えて比べます。やり方は後で順に書きます。

RAGを作った人
資料はちゃんと入れましたよ。入っていないなんてこと、あるんですか?
弊社
あります。AIに資料を読ませて入れてもらうと、要約を頼んでいなくても縮むことがあります。弊社の社内ツールで測ったので、次でお見せします。

資料を入れただけなのに、縮むことなんてあるの?

AIに資料を入れてもらうとき、入れ方は大きく2つに分かれます。

  • 書き写して入れる:AIが資料を読み、本文を自分で打ち直してから入れる
  • ファイルのまま入れる:ファイルの中身を、AIが書き直さずにそのまま入れる

人にたとえると、前者は資料を人に手で書き写してもらうこと、後者はコピー機にかけることです。

このブログを書いている弊社も、社内のツールでAIに資料を渡して保存させ、それを材料に文章を書かせています。

2026年9月7日、そのツールで同じ資料を3回入れ、入った本文を元の資料と比べました。資料は、弊社が公開している手順の記事1本、約1万字です。

入れ方

本文は元の何%か

AIに書き写させた(要約の指示なし)

84.2%

AIに書き写させた(「要約して入れて」と頼んだ)

48.5%

書き写させず、ファイルのまま入れた(「全文をそのまま」と頼んだ回)

欠けたところは見つからなかった

1回目は、要約を頼んでいません。それでもAIは、約1万字を自分で打ち直すうちに、15.8%を落としました。

なお、この1回目の本文は、縮んでもまだ弊社のツールが一度に受け付ける長さを超えていたので、保存される直前にツールが止めました。84.2%は、そのときAIが入れようとしていた本文の長さです。止める仕掛けの無い仕組みなら、この本文がそのまま入っていたことになります。

2回目は、頼んだとおり半分以下です。資料を入れるときに「要約して入れて」と頼んだ覚えがあるなら、中身が元の半分ほどになっている可能性があります。

3回目だけ、元の資料と突き合わせても、落ちている段落・文・語が見つかりませんでした。

持ち帰ってほしいのは、ここだけです。要約を頼まなくても、AIに書き写させると縮みました。欠けなかったのは、ファイルのまま入れた回だけです。

自分の仕組みがどちらの入れ方で入っているかは、今は分からなくてかまいません。後で数えれば分かります。

84.2%も残っているなら、十分じゃないの?

割合だけ見ると、そう見えます。

そこで、1回目に何が消えたのかを、元の文と1つずつ突き合わせました。消えていたものを3つ出します。

元の文

AIが書き写した文

失われたもの

上に「ミーティング」「記録」「電話」みたいなタブが並んでます。「記録」を押す。

上に並ぶタブの「記録」を押す。

画面で迷わないための目印(タブの名前3つ)

文字起こしができるまで30分〜1時間かかるので、その間は別の作業をしてて OK。

文字起こしができるまで30分〜1時間かかります。

待っていていいのか、という判断

「システムがおかしい」と思って半日調べたんですけど、犯人はただコピペの仕方でした。笑

(まるごと削除)

書き手の声

弊社は、この資料を入れたRAGの答えまでは測っていません。ただ、理屈で言えることがあります。入っていない一文は、答えの材料になりようがありません。

  • タブの名前が入っていなければ、「どこを押せばいい?」と聞いても、答えにタブの名前は出てきません
  • 「その間は別の作業をしてて OK」が入っていなければ、「待っている間はどうすれば?」に、資料からは答えられません
  • 書き手の声が入っていなければ、答えは内容が正しくても、誰が書いたか分からない言い回しになります

冒頭の「答えが薄い」「資料にあるはずのことが出てこない」「一般論になる」と、形が重なります。

消えていたのは余計な言い回しではなく、画面の目印と、判断の一文と、書き手の声でした。

AIに渡す材料が足りないと、出てくる文章が薄くなる。その話はAIに書かせた文章が「なんか薄い」の正体にまとめてあります。

「全部入れた?」とAIに聞けば、分かるんじゃないの?

入れ終わったあとに聞けば確かめられそう、と思うかもしれません。

1回目のあと、落とした理由をAIに聞くと、返ってきた説明は「読みやすく整えた」でした。

AIには、縮めた自覚がありません。削ったのではなく、整えたつもりでいます。

だから「全部入れた?」「要約してない?」と聞いても、確かめたことにはなりません。縮めたと思っていない相手に、縮めたかどうかを聞くことになるからです。

RAGを作った人
それって、AIが嘘をついているんですか?
弊社
嘘というより、AIの中では『整えただけ』なんです。だから、聞いても出てきません。確かめるなら、数えるほうが確かです。

「要約しないで」と書き足しておけば、防げるんじゃないの?

防げるとは言えません。弊社がAIに向けて書いておいた注意書きは、読まれても守られませんでした。

弊社のツールには、大きい資料は打ち直さず、ファイルのまま渡すように、というAI向けの注意書きを付けてあります。1回目のAIは、それを受け取ったうえで、自分で書き写す入れ方を選んでいます。

頼みごとに「要約しないで」と書き足す形では、弊社は試していません。ただ、AIに文章でお願いするという点では同じなので、同じことが起きても不思議はありません。

しかも、AIが要約だと思っていない操作は、「要約しないで」という注意の外側で起きます。前の節のとおり、AIは整えたつもりでいるからです。

だから、お願いを強くするより、入れ方を変えます。

自分の仕組みでは、どう確かめればいいの?

ここまでの数字は、弊社のツールで測ったものです。お使いの仕組みで同じ数字になる根拠はありません。

だから、手元で数えてください。手順は3つです。

1. 資料を1本選び、元の文字数を自分で数える

「答えに出てこない」と感じた資料から選ぶのが早いです。

Word や Googleドキュメントなら、文字数を数える機能があります。空白を含めない数を控えておきます。

パワーポイントやPDFでも、やることは同じです。中の文字をコピーして Word などに貼れば数えられます。面倒なら、ここは飛ばして、次の手順でAIに数えてもらうだけでもかまいません。

2. AIに、2つの文字数を並べて出してもらう

仕組みを作ってくれたAIに、こう頼みます。

この資料について、元のファイルと、保存されている本文の文字数を、どちらも空白と改行を抜いて数えて、2つ並べて出して。小分けで入っているなら、この資料のぶんを全部足して。

Dify や NotebookLM のような道具に入れた場合は、その道具の画面で入っている本文を開けるなら、コピーして手順1と同じやり方で数えます。

RAGを作った人
AIに聞いても分からない、とさっき書いてありましたよね? AIが出した数字を信じていいんですか?
弊社
聞くのは『全部入れた?』という感想ではなく、『何文字?』という数です。それでも心配なら、手順1で自分で数えた数と、AIが出した元のファイルの文字数を見比べてください。次の手順で使います。

3. 数え方が揃っているか確かめてから、比べる

まず、手順1で自分で数えた数と、AIが出した元のファイルの文字数を見比べます。ほぼ同じなら、数え方も揃っています。

揃っていないと、それだけでずれます。弊社の資料も、数え方によって10,170字にも11,358字にもなりました。1割ほどの差です。

このずれは、数え方が揃っていないときだけ起きます。揃っていると確かめたあとに残った差は、中身の差です。

揃っていたら、元の文字数と、保存されている本文の文字数を比べます。弊社の目安は、次のとおりです。

  • 1割以上減っていたら、縮んでいると見てください。弊社の1回目は、要約を頼んでいないのに15.8%減っていました
  • 減ってはいるが1割未満なら、まだ決めつけられません。答えに出てこなかった一文を1つ選び、保存されている本文の中にあるかを、AIに探してもらいます
  • ほぼ同じか、少し多いなら、ひとまず入っています。ファイルのまま入れた3回目は、整えるための記号やリンクのアドレス(URL)が足されて、元より少し長くなりました

確かめる方法は、聞くことではなく、数えることです。

縮んでいたら、どうすればいいの?

頼み方を強くするより、入れ方を変えます。AIに本文を書き写させない入れ方にします。

AIに作ってもらった仕組みなら、作ってくれたAIにこう頼みます。

資料を保存するとき、AIが本文を打ち直して入れるのをやめて、ファイルの中身をそのまま入れる形に直して。すでに入っている資料も、元のファイルから入れ直して。

入れる前に、AIに資料を読みやすく整えさせたり、要約させたりしていたなら(「前処理」のつもりでも)、整える前の元のファイルを入れ直します。

入れ直したら、手順2の頼み方で、もう一度数えます。頼んだだけで済ませません。

RAGを作った人
自分ではツールを作れないんですが、それでもできますか?
弊社
できます。やることは、上の頼み方で作り直してもらうことと、入れたら数えることの2つだけです。作り直しを頼んだあとも、数えれば、頼んだことが届いたかどうかが分かります。

元のまま入っていたら

ここで初めて、チャンクの大きさや検索の設定に進みます。

資料が元のまま入っていると分かっていれば、答えが薄い原因を、切り方や探し方に絞って探せます。そこから先は、「RAG チャンク」「RAG 検索精度」で調べると出てくる、切り方や探し方の話の出番です。

この記事の数字は、どこまで確かなの?

ここは、数字の条件をまとめた節です。読み飛ばして、最後の「明日やること」へ進んでもかまいません。

  • RAGの答えの良し悪しは、測っていません。測ったのは、入った本文が元の資料の何%か、までです
  • 測ったのは2026年9月7日、弊社の社内ツールだけです。ほかのツールやAIで同じ数字になる根拠はありません
  • 資料は1本(弊社が公開している手順の記事、約1万字)で、どの数字も1回ずつの値です
  • 3回目は、「全文をそのまま」と頼んだ回でもあります。そう頼むだけで同じ結果になるかは、試していません
  • 84.2%は、同じ数え方どうしで割った値です。48.5%は、元の資料をどう数えたかが記録に残っておらず、同じ数え方どうしで割った保証がありません
  • 1回目にAIが書き写した本文は、保存の手前で止めたため残っていません。84.2%と消えた3つの例は、そのとき確かめた結果で、後から確かめ直すことはできません
  • 3回目の「欠けたところは見つからなかった」は、目で読んで探した結果です。1文字ずつ機械で突き合わせてはいません

まとめ:明日やること

RAGの答えが薄いとき、調べて出てくるのは、チャンクや検索の直し方です。

その前に、入れた資料が元のまま入っているかを確かめてください。弊社で測った範囲では、AIに書き写させる入れ方だと、要約を頼まなくても資料は縮み、AIにはその自覚がありませんでした。

明日やることは3つです。

  1. 入れた資料を1本選んで、元の文字数と、データベースに入っている文字数を、同じ数え方で比べる
  2. 1割以上減っていたら、AIに書き写させない入れ方に変えて、もう一度数える
  3. 元のまま入っていると確かめてから、チャンクや検索の設定に進む

資料の1つに、打ち合わせの文字起こしを入れている方へ。

Zoomで打ち合わせをするだけで、文字起こしと議事録ができて、案件ごとのフォルダに溜まっていくキットを、無料で配っています。作るのに20分、追加の課金はいりません。

LINEで受け取る

LINEが開きます

マーケティング施策でお困りですか?

戦略立案から実行まで、成果につながるマーケティング支援を提供します。

お問い合わせ