ChatGPTが公開されてから約2年が経過した。その間、生成AIはビジネス現場からSNS、そしてウェブメディアまで幅広く浸透してきた。そして最近、ある研究がひとつの数字を示した。ChatGPT登場以降に公開されたウェブページのうち、実に3分の1にAI執筆の痕跡が確認されるというものだ。この数字を初めて見たとき、正直なところ驚きよりも「やはりそうか」という感覚の方が強かった。
研究が明らかにしたこと
この研究では、大規模なウェブクロールデータを解析し、2022年末以降に公開されたテキストコンテンツの文体的特徴や語彙パターンを機械学習モデルで分類した。その結果、対象ページの約33%において、AI生成テキストに典型的なパターンが検出されたという。特にニュースアグリゲーションサイト、製品レビューページ、SEO目的のブログ記事においてその割合が高く、一部カテゴリでは50%を超えるケースもあった。
もちろん、「AI執筆の痕跡がある」ことと「完全にAIが書いた」ことはイコールではない。人間がAIの補助を受けながら書いたテキストも検出対象に含まれている可能性は高い。それでも、これほどの規模でインターネット上のテキストが変化しているという事実は、無視できない重さを持っている。
なぜこれが重要なのか
この問題が単なる「AIの利用率が上がった」という話に留まらない理由がある。インターネット上のテキストは、次世代のAIモデルのトレーニングデータとして使われる。つまり、AIが生成したコンテンツがウェブを埋め尽くすと、それを学習した次のモデルはAI的な文体や思考パターンをさらに強化して出力するようになる。研究者の間ではこの現象を「モデル崩壊(model collapse)」や「データ汚染」と呼び、深刻なリスクとして警戒する声が上がっている。
エンジニアとしての自分の立場から言えば、これはデータパイプラインの品質問題と本質的に同じ構造だと思っている。ゴミを入れればゴミが出てくる。ただし今回のケースは、そのゴミがかつて「良質なデータ」として使われていた人間の書き物と外見上区別しにくいという点で、より厄介だ。
私たちはこの現実とどう向き合うべきか
AIツールを活用してコンテンツを生産すること自体を悪と断じるつもりはない。ツールは使いようであり、AIを使って効率的に質の高い情報を届けることは十分に意義がある。問題は、量を稼ぐためだけにAIを使い、内容の検証も編集も省略したコンテンツがウェブを侵食していることだ。
読者として、そして情報を発信する側の人間として、今後はコンテンツの「出どころ」と「検証プロセス」をより意識的に問う必要があると感じている。ウェブの信頼性を保つのは、結局のところ一人ひとりの情報リテラシーにかかっている。AIがどれだけ賢くなっても、その責任は人間の側にあり続ける。それが少し重いと感じつつも、自分はそれを引き受ける側でありたいと思っている。
