※当ブログはアフィリエイト広告を掲載しています

生成AIの仕組みを生成AIの仕組みを文系にもわかるように解説

未分類
※当ブログはアフィリエイト広告を掲載しています

はじめに

「ChatGPTってどうして人間みたいに文章を書けるの?」「画像生成AIはどうやって絵を描いているの?」——こうした疑問に、数式を使わず、日常の比喩で答えていきます。実は生成AIの裏側には、物理学や統計学の考え方が驚くほどそのまま使われています。難しい記号は出てきますが、意味さえわかれば怖くありません。

1. AIは「巨大な料理のレシピ」

AI(ニューラルネットワーク)は、入力(質問文など)を受け取って、出力(答え)を返す、巨大な変換装置です。イメージとしては、材料(入力)を何段階もの工程(層)にかけて、最終的な料理(出力)に仕上げる「超長いレシピ」だと考えてください。

各工程では、材料の配合比率を少しずつ変える「調味料の匙加減」のような操作をしています。この匙加減の数値(専門用語で「重み」)が、AIの中に数十億〜数千億個も存在します。AIの「学習」とは、この匙加減を、美味しい料理(正しい答え)ができるまで、気の遠くなる回数だけ微調整し続ける作業のことです。

なぜ工程を何段階にも分けるのか。もし全部の工程が「材料を混ぜるだけ」の単純な操作(専門的には「線形」)だったら、どれだけ工程を増やしても、結局は一回混ぜたのと同じ結果にしかなりません。途中に「焼く」「発酵させる」といった、混ぜるだけでは説明できない変化(専門的には「非線形」)を挟むからこそ、複雑な料理(=言語の文法や画像の意味)を再現できるのです。

2. 学習は「山を下って谷を探す旅」

AIの学習は、「なるべく間違いの少ない答えを出せる匙加減」を探す作業です。この「間違いの大きさ」を、地図上の標高だとイメージしてください。標高が高いほど間違いが多く、谷底にたどり着くほど正解に近づきます。

AIは、今立っている場所の傾斜(どちらに進めば下るか)を計算し、少しずつ谷底へ向かって歩いていきます。これはまるで、深い霧の中で足元の傾き具合だけを頼りに、山を下っていく登山者のようなものです。

ここで面白いのが、まっすぐ最短距離で下ると、途中にある小さなくぼみ(本当はもっと低い谷があるのに、そこで止まってしまう場所)にはまり込んでしまうことです。これを防ぐために、AIの学習にはわざと「ランダムな揺れ」を混ぜます。酔っ払って千鳥足で歩くことで、小さなくぼみを乗り越えて、より深い谷を見つけやすくなる、というイメージです。この「ランダムな揺れを利用して良い解を探す」という発想は、実は金属を熱してからゆっくり冷やして硬く仕上げる「焼き入れ」という金属加工の技術からヒントを得たものです。物理学の知恵が、AIの学習方法にそのまま応用されているわけです。

3. AIは「賭け」をしている

AIが文章を生成するとき、実は次に来る単語を100%の自信で決めているわけではありません。「次はこの単語が来る確率70%、こっちは20%、それ以外は10%」というように、いつも確率で考えています。そして、その確率に従って「くじ引き」のように単語を選んでいるのです。

この確率の決め方には、物理学の「エネルギーが低い状態ほど実現しやすい」という自然の法則とそっくりな数式が使われています。自然界では、ボールは坂の下(エネルギーが低い場所)に転がりやすいように、AIの世界でも「もっともらしい(自然に感じる)単語」ほど選ばれやすくなっています。

ちなみに、AIの設定でよく見る「temperature(温度)」という項目は、まさにこの物理法則から借りてきた言葉です。温度を上げると、AIは冒険的でランダムな単語選びをするようになり、下げると、いつも一番無難な単語ばかり選ぶようになります。まるで、冷静な人ほど当たり障りのない発言をし、興奮した人ほど突拍子もないことを言い出すのに似ています。

4. 文章の理解は「教室での視線配り」

ChatGPTのような最新のAI(Transformerという仕組み)は、文章を読むときに、すべての単語を平等に見るのではなく、「今考えている単語にとって、どの単語が重要か」を判断しながら読みます。

これは、先生が教室で発言を聞くとき、話の内容によって視線を配る生徒を変えるのに似ています。「犬が公園で走っている」という文を読むとき、「走っている」という動詞を理解する上で重要なのは「犬」であって「公園」の重要度はやや低い、というように、単語同士の関連度を毎回計算し直しているのです。

この関連度の計算には、単語を「意味の地図」の上の点として表現する工夫が使われています。似た意味の単語ほど地図上で近い場所に置かれ、AIは「二つの単語がどれくらい近いか(=関連が深いか)」を、方角の近さを測るような計算で求めています。

5. 画像生成AIは「砂絵を逆再生する」

画像生成AI(Stable DiffusionやMidjourungeなど)の仕組みは、さらにユニークな物理現象がヒントになっています。

学習の際、AIはまず綺麗な写真に少しずつ「砂嵐(ノイズ)」を混ぜていき、最終的に何が写っているかまったくわからない、真っ白なノイズ画像にしてしまいます。これは、絵の具をコップの水に垂らすと、時間が経つにつれてじわじわ水全体に広がって色が消えていく「拡散現象」とまったく同じ数学で説明できます。

そして生成AIは、この「絵の具が水に広がっていく過程」を逆再生する方法を学習します。つまり、真っ白なノイズから、少しずつノイズを取り除いて、元の(あるいは新しい)綺麗な画像を「浮かび上がらせる」のです。まるで、映画を逆回しにして、水に溶けた絵の具が一滴のインクに戻っていく様子を見ているようなものです。物理的には本来起こりえない「秩序が自然に生まれる」現象を、AIは統計的な計算によって疑似的に実現しているのです。

まとめ

生成AIは魔法ではなく、「間違いの少ない匙加減を探す(山下り)」「確率のくじ引きで言葉を選ぶ(賭け)」「文脈に応じて注目先を変える(視線配り)」「ノイズから絵を浮かび上がらせる(拡散の逆再生)」という、物理学や日常経験にある考え方の組み合わせでできています。数式の中身がわからなくても、「自然界の法則をお手本にした、巨大な試行錯誤の装置」だとイメージできれば、生成AIのニュースも一段と面白く読めるはずです。


コメント

タイトルとURLをコピーしました