アルゴリズムが世界を変える──あなたの知らない機械学習の全貌

気づいていないかもしれませんが、機械学習アルゴリズムはすでに人間の生活のあらゆる側面に浸透し、増え続けるデータから学習することでますます強力になっています。『マスターアルゴリズム』(2016年)は、現在存在するアルゴリズムの種類、それらが直面する問題、提供できる解決策、そして未来をどう変革するかについて、幅広く概説します。

この要約でわかること:アルゴリズムが世界を変える仕組み

世界最大の謎の一つは、新生児の頭の中にある約500グラムの灰色のゼリー状の塊が、いかにして最終的に意識の流れを生み出し、世界を知覚し相互作用できるようになるかです。さらに驚くべきなのは、この変化の間、脳がほとんど教育を必要としないことです。人類史上、人間の脳に匹敵する学習能力を持つ機械は存在しません。しかし、状況は変わりつつあります。

私たちはますます洗練された機械を作り出す能力を手に入れており、将来、それらが脳に挑戦できるようになるかもしれません。機械は人間の能力を超える可能性さえあります。私たちが日々遭遇しながら無視している膨大なデータから学習することができるのです。それでは、思考の帽子をかぶり、アルゴリズムと機械学習の魅力的な世界を探検してみましょう。

この要約では、以下のことがわかります。

  • 将来、機械が指示なしで学習できるようになる方法
  • パターン認識が時に問題となる理由
  • テトリスで勝つためのアルゴリズムが通勤経路の改善に役立つ方法

料理のレシピにある「中火で15~20分」といった曖昧な指示にイライラしたことはありませんか?もしそうなら、あなたは良いアルゴリズムを好むタイプかもしれません。

機械学習は、データからアルゴリズムを導き出し、重要課題を解決する

レシピとは異なり、アルゴリズムは毎回同じ結果を生む正確な命令の列です。普段気づかないかもしれませんが、アルゴリズムは至る所で使われています。航空便のスケジュール調整、荷物の配送経路の決定、工場のスムーズな稼働などです。これらの標準的なアルゴリズムは、情報を入力として受け取り、タスクを実行し、結果を出力するように設計されています。

例えば、道案内をタスクとするアルゴリズムがあるとします。2点を入力すると、その2点間の最短経路が出力として得られます。しかし、機械学習(ML)アルゴリズムはもう一段階抽象的です。それは、別のアルゴリズムを出力するアルゴリズムなのです。入力と出力のペアの多数の例を与えて学習させると、入力を出力に変換するように見えるアルゴリズムを見つけ出します。これは、人間のプログラマーが正確に記述できないタスク(手書き文字の認識など)のためのアルゴリズムを見つけるのに便利です。自転車に乗るのと同じで、手書き文字の判読は私たちが無意識に行っていることです。私たちはそのプロセスを言葉にすることさえ難しく、ましてやアルゴリズム化するのは困難です。機械学習のおかげで、それをしなくて済みます。手書きテキストの例を入力として、テキストの意味を望ましい出力としてMLアルゴリズムに与えるだけでいいのです。その結果、一方を他方に変換できるアルゴリズムが得られます。学習したら、そのアルゴリズムをいつでも自動手書き認識に使えます。実際、郵便局はあなたが荷物に書いた郵便番号をこれで読んでいます。

このようなMLアルゴリズムが素晴らしいのは、多様なタスクに使えることで、新たに発生する問題も十分なデータを集めれば解決できる点です。つまり、元になるアルゴリズムは多くの場合同じで、一見無関係な問題を解決するために調整を加える必要はありません。例えば、医療診断や迷惑メールのフィルタリング、チェスの最善手を考えることは、まったく異なるアルゴリズムを必要とすると思うかもしれません。しかし実際には、一つのMLアルゴリズムと適切なデータがあれば、これらの問題はすべて解決できるのです。

パターンの幻覚を防ぐには、学習アルゴリズムに制約をかけ、妥当性を検証する必要がある

幻覚とは、実際には存在しないものを見ることです。興味深いことに、幻覚はアルゴリズムの世界における中心的な問題です。1998年のベストセラー『バイブル・コード』は、聖書に隠された予言が特定の行や文字を選択的に飛ばすことで明らかになると主張しました。しかし批評家たちは、『白鯨』や最高裁判所の判決文にも同様の「パターン」が見つかることを示して、この主張を反証しました。これはパターンの幻覚の良い例であり、機械学習用語では過学習(オーバーフィッティング)の結果です。過学習は、アルゴリズムがあまりに強力で、何でも「学習」できてしまうときに起こります。聖書のようなデータセットに十分な計算能力を注ぎ込めば、いずれ必ずパターンが見つかります。なぜなら、コンピューターは複雑なモデルを次々に構築し、どこかでパターンが現れるからです。しかし、その結果得られたモデルは他のデータにはまったく使えません。ですから、アルゴリズムを制御するには、その複雑さを制限することでその力を制限する必要があります。適切な種類の制限をかけることで、アルゴリズムの範囲が広がりすぎないようにし、結果が検証可能で一貫していることを保証します。

もし柔軟すぎると、あなたのアルゴリズムは『バイブル・コード』のように、与えられたどんなテキストやデータにもパターンを見つけ出してしまうかもしれません。では、アルゴリズムが手持ちのデータを説明する複数のパターンを発見したが、新しいデータではそれらが一致しない場合はどうでしょう?どの結果を信じればいいのでしょうか?そして、結果が単なる偶然ではないと100%確信するにはどうすればいいのでしょうか?ここでホールドアウトデータが登場します。学習アルゴリズム用に元のデータセットを準備する際には、アルゴリズムが学習に使う訓練セットと、テスト用のホールドアウトセットに分割することが重要です。この方法で結果を再チェックし、データに見つかったパターンが妥当かどうかを確認できます。結果の妥当性を保証することが機械学習エキスパートの仕事のすべてです。彼女の仕事は、ルールが柔軟すぎないようにし、結果が訓練セットとホールドアウトセットの両方で良好に機能するようにアルゴリズムの力を制限することです。

演繹的推論と決定木で、機械は論理的に思考できる

医学の世界に身体の治療法に好みの流儀を持つ専門医がいるように、機械学習の世界には独自の視点と好みのアルゴリズムスタイルを持つ専門分野があります。例えば記号主義者(シンボリスト)は、人工知能(AI)を生み出すために記号を操作しルールを学習します。シンボリストはAIコミュニティで最も古い一派で、感覚を信頼できないと見なす合理主義者であり、したがってすべての知能は論理的方法によって学習されなければならないと信じています。このため、記号主義者が好むアルゴリズムは逆推論(インバースディダクション)です。

一般的に、逆推論は別々の文を結びつけてルールを作ります。例えば、「ナポレオンは人間である」と「それゆえナポレオンは死ぬ」という2つの文を与えると、アルゴリズムは「人間は死ぬものである」というより広い文にたどり着きます。この種のアルゴリズムは、医療記録のような比較的大量のデータのデータマイニングや選別には適していますが、本当に巨大なデータベースでは、データ内のすべての変数間の可能な関係を考慮しなければならず、複雑さが指数関数的に増大するため、コストがかかり非効率です。そこで、この作業を単純化するために決定木を使ってこれらのルールを見つけることができます。その名の通り、決定木はデータをより小さな集合へと枝分かれさせます。これは基本的に「20の質問」ゲームをするようなもので、各質問またはルールが選択肢と可能性をさらに絞り込みます。例えば、医療記録をふるい分けるルールを考え出すとしたら、決定木を使えます。最初は全記録から始めますが、木のさまざまな分岐点で「健康」「白血病」「肺がん」などのグループに分割します。MLアルゴリズムは、この分割をもたらす適切なルールを見つけ出します。この手法は、決定木が尋ねる質問の数を制限することで、最も広く適用可能で一般的なルールだけが適用されるようにし、過学習を防ぎます。決定木は、症状を絞り込んで医療診断を行うソフトウェアで使われています。また、最高裁判所の判決結果を75%の精度で予測できるアプリケーションにも使用されました。人間の専門家パネルの予測精度は60%未満でした。次の項では、より扱いにくく、より人間的な種類のデータ、つまり不確かだったり矛盾していたりするデータの扱い方を見ていきます。

モデルをオープンに保ち、仮定を制限することで過学習を防ぐ

ベイジアン(ベイズ主義)もまた人気のある機械学習の一派で、その信奉者たちの熱意はほとんど信仰に近いほどです。合理主義者とは対照的に、ベイジアンは論理的推論には欠陥があり、真の知能は観察と実験から生まれると信じる経験主義者です。彼らが好むアルゴリズムはベイズ推論と呼ばれ、複数の異なる仮説やモデルを同時にオープンに保つことで機能します。それぞれの仮説やモデルをどの程度信じるかは、データに見つかる証拠によって変わり、中には他よりも多くの支持を集めるものが必ず出てきます。

このアプローチは医療診断にも役立ちます。多くの仮想的な病気とその症状に対してオープンなままで、アルゴリズムは患者の記録データをふるいにかけ、最適な一致を見つけます。記録が提供するデータが多ければ多いほど、アルゴリズムはより多くの病気を除外し、最終的に一つの仮説が統計的な勝者となります。ベイズ推論は強力なアルゴリズムであり、原因と事象に関する仮定を制限することで過学習を防ぎます。例えば、あなたがインフルエンザにかかっていることが明らかだが、発熱や咳もあるかどうか知りたいとします。インフルエンザを原因、発熱や咳を事象として分類できます。ここでの制限的な仮定は、二つの事象が互いに影響を及ぼさない、つまり咳があることが発熱の確率に影響しないと仮定することです。事象間の可能なつながりを無視することで、ベイズ推論は原因と結果のつながりに厳密に焦点を当て、過学習して強力になりすぎるのを避けます。同様の仮定はSiriのような音声認識ソフトウェアでも使われています。あなたが「警察を呼んで!(Call the police!)」と言うとき、ベイズ推論は選択肢をオープンに保ち、「Call the please!」と言った可能性がどれだけあるかを考慮します。しかし、よく使われるフレーズのデータベースを調べる際には、特定の単語が他の単語の後にどれくらいの頻度で現れるかを見るだけで十分です。そしてこの場合、「the」の後には「please」よりも「police」がはるかに高い頻度で現れることは明らかです。

教師なし学習アルゴリズムは、生データから構造と意味を見つけるのに長けている

誰かがあなたの名前を呼ぶと、たとえそれが小さな声で、周りが大声で話す人々でいっぱいでも聞こえることに気づいたことはありますか?私たちは耳が拾う情報をフィルタリングして集中する驚くべき能力を持っています。アルゴリズムも同じことができるでしょうか?実は、教師なし学習は、生のノイズの多いデータを使うように設計されたアルゴリズムのカテゴリです。

前の項で紹介したアルゴリズムはすべて、正しい診断の例やスパム/非スパムとラベル付けされたメールなど、ラベル付きの例を含むデータを使って学習してきました。しかし、クラスタリングアルゴリズムは教師なし学習の一群で、大量の生データからカテゴリを発見できます。これは、何百万ものピクセルの中から顔や物体を識別したり、騒がしい群衆の中で特定の声を聞き分ける画像認識や音声分離ソフトウェアに使われる種類のアルゴリズムです。これらのアルゴリズムは、探しているものの記述をその本質的な要素にまで落とし込むことでデータの次元を削減し、このような意味のある構造を見つけ出します。例えば、似顔絵捜査官は、鼻、目、耳など各顔の特徴の10通りのバリエーションを記憶しているため、非常に正確に顔を再現できます。これにより選択肢が大幅に絞り込まれ、説明だけでもある程度通用する似顔絵を描くことが可能になります。

同様に、顔認識アルゴリズムは、さまざまな選択肢を前処理した後、100万ピクセルではなく数百の変数を比較するだけで済みます。ニューラルネットワークもまた、膨大な量の生データを処理する効果的な方法です。他のアルゴリズムが逐次的にデータを処理するのに対し、ニューラルネットワークは脳のように働き、複数の入力を同時に処理します。これまでに作られた最大級のニューラルネットワークの一つは、無作為に選ばれた1000万本のYouTube動画をふるいにかけるのに3日間を費やしました。そして、何を探すべきか教えられていなかったにもかかわらず、そのプログラムは人間の顔、そしておそらく驚くには当たらないことですが、猫を認識するようになりました。これらさまざまなアルゴリズムを知った今、それらがすべてマスターアルゴリズムに統合されたら何が起こるのか、考え始めたことでしょう。では、見ていきましょう。

完璧なアルゴリズムは存在せず、大きな問題に取り組むには統一的なマスターアルゴリズムが必要である

さて、これほど多くの異なるアルゴリズムがあると、どれが最善なのか疑問に思うかもしれません。真実は、完璧なアルゴリズムというものは存在せず、すべてが異なる基本的仮定に依存しているということです。驚くべきことに、あるデータセットでアルゴリズムが何か役に立つものを導き出すと、別のデータセットでは同じアルゴリズムを使ってそのすべてが無意味だと示すこともできます。だからこそ、アルゴリズムを適用するデータについて正しい仮定をすることが重要なのです。幸いなことに、これは思ったほど大きな問題ではありません。コンピューターサイエンスにおける最も難しい問題の大半は根本的に関連しており、一つの優れたアルゴリズムで解決できる可能性があります。すでに解決されたいくつかの問題を考えてみてください。複数の都市を訪れる最短経路を見つけること、データ圧縮、都市の交通流制御、2D画像を3D形状に変換すること、マイクロチップ上に部品を配置すること、そして最後に重要なのがテトリスで勝つことです。これらの問題の一つに対する効率的な解決策を見つけることで、本質的にすべてを解決できました。一つのアルゴリズムがこれほど多くのことに対処できるとは信じがたいかもしれませんが、それは真実であり、コンピューターサイエンス全体で最も魅力的な洞察の一つと考えられています。残念ながら、人類が直面する最も重要な問題は、現在利用可能なアルゴリズムよりもはるかに高性能なものを必要とします。

例えば、がんの治療法を考え出すためには、究極のアルゴリズムはこれまでに蓄積されたすべての知識を取り込むだけでなく、新しい科学的発見が発表される速いペースについていく必要があります。その上で、これらすべてのデータの関連性を考慮し、まだ誰も見ることができていない包括的な構造を見抜かなければなりません。これは現在のアルゴリズムの能力を超えていますが、進歩は遂げられています。例えば、マンチェスターの生物学研究所にいる研究ロボット「アダム」は、遺伝学に関する一般的な知識を学習し、仮説を提案することができます。実験を設計・実施し、結果をテスト・分析することさえできるのです!「データは新しい石油である」とは、少なくとも現代のビジネス予言者たちが言うことです。

現代ビジネスでは、最適なアルゴリズムと最適なデータを見つけることが成功の鍵である

これに反論するのは難しいでしょう。なぜなら、大企業の世界では、最高のアルゴリズムを持つ企業が勝つと多くの人が感じているからです。インターネット以前の時代には、企業が消費者との接点に問題を抱えた場合、より良い広告キャンペーンを考案するなど物理的な解決策で対応できました。しかし、インターネットの登場で消費者の選択肢は事実上無限になり、今や問われるのは、1000万もの選択肢がある中で何を買うかをどう決めるかです。ここで機械学習が登場し、選択肢を絞り込む手助けをします。アマゾンは、顧客が好みそうな商品を提案する知的なレコメンド機能で競争をリードしており、そのサービスはほぼすべての市場をカバーしています。しかし競争は続いています。そして、最高のデータを持つ者が最高のアルゴリズムを生み出せるため、データは非常に大きな戦略的資産なのです。オンライン広告業界におけるユーザーのデータ痕跡の平均価値は年間約1,200ドルです。グーグルのあなたに関するデータは約20ドル、フェイスブックのは5ドルです。データ購入ビジネスは非常に巨大化しており、専門家は、データ組合やデータバンクがいずれ一般市民や企業が自分たちのデータの利用について公正な交渉を行えるようにするだろうと考えています。データバンクはあなたの情報を安全に保管し、いつ、どのようにアクセスされるかについて条件を設定できるようにします。またデータ組合は他の労働組合と同様に運営され、同じ考えを持つ人々が力を合わせ、情報が公正かつ正確に利用されるようにします。このような規制はすべての人に利益をもたらす可能性があります。企業にとってはアルゴリズムの改善に役立ち、あなたはより良い購入レコメンドを得られ、セキュリティが強化されることで、より多くの人々が医療や人道的目的を進めるためにデータを共有することに抵抗を感じなくなるかもしれません。

将来、あなたは自分のデジタルモデルを持ち、生活をより楽にできる

あなたも一度や二度、独り言をつぶやいているところを見られたことがあるでしょう。もし自分に話しかけるのではなく、自分と会話できたらと思ったことがあるなら、その夢はもうすぐ実現するかもしれません。あなたのすべてのデータを究極のマスター学習アルゴリズムと共有すれば、かなり正確な自分のデジタルモデルを手に入れることができます。マスターアルゴリズムを想像してみてください。人間の一般的な知識をすべて含むデータベースを種として与えられ、あなたが生涯を通じて収集したすべてのデータ、つまりメール、通話記録、ウェブ検索履歴、購入履歴、ダウンロード、健康記録、GPSの移動経路などでパーソナライズされます。そうして学習済みのデジタル版の自分をフラッシュドライブにダウンロードし、ポケットに入れて持ち歩き、個人的な執事のように自分の生活を運営するのに使えます。あなた専用のデジタルな自分がいれば、ちょっとした煩わしさを素早く片付けられ、時間と手間を省けます。自動ウェブ検索や新しい本や映画の推薦といった簡単なことに加えて、確定申告を代行し、クレジットカードの請求書を支払い、メールを整理し、休暇の計画を立て、もし独身ならデートのセッティングさえしてくれるかもしれません。あるいは、内省的な気分になったら会話モードに設定して、デジタルモデルとおしゃべりすることもできます。デジタルモデルが当たり前になった社会では、あなたの代理として世界とやりとりすることも可能です。新しい仕事を探していると想像してください。LinkedInで少し時間を費やした後、あなたのモデルは応募可能なすべての適切な仕事に応募し、あなたが見過ごしていたかもしれない完璧な仕事も含めてリストアップします。企業側にもパーソナルモデルがあるかもしれませんし、あなたのデジタルの自己がそれらとやりとりして、面接に同意したすべての企業のリストをあなたに提供します。あなたがしなければならないのは、日時を確認するだけです。あなたのデジタルの自分はパワーステアリングのようなもので、行きたいところへ、より少ない手間とほんのわずかな努力でたどり着けるようになるでしょう。

最後のまとめ

この本の核心的メッセージ:機械学習アルゴリズムは、ほんの少数の仮定と大量のデータさえあれば魔法を起こす、普遍的な問題解決ツールです。機械学習の現在の各分野を一つの究極のマスターアルゴリズムに統合することは、歴史上のどんな単一の出来事よりも人類を進歩させるでしょう。今日の時点でも、高度なアルゴリズムと個人データへのアクセスは、企業が競争力を持つためにすでに不可欠です。実践的なアドバイス:自分のデータの痕跡を意識しましょう。

すべてのデジタル上のやり取りには二つのレベルがあります。欲しいものを手に入れることと、あなた自身についてコンピューターにもう少し教えることです。第二のレベルは長期的に見てより重要です。なぜなら、タスクの遂行を助けてあなたに奉仕するためにも、また、あなたが買いたくなるような広告やレコメンドを表示してあなたを操作するためにも使われるからです。ですから、注意してください。現在のインターネットセッションがあなたのパーソナライゼーションに影響を与えたくないなら、シークレットモードにしてください。また、自分の履歴に基づいて子供たちにおすすめ動画や広告が表示されたくないなら、必ず別のアカウントを使いましょう。

あわせて読みたい本:ニック・ボストロム著『Superintelligence』(2014年)は、人間より知能の高い機械を作ることが人類をどう変えるかを探求しています。本書は、さまざまな分野の事実や数字や研究が満載で、超知能の未来とそこに至る道筋の複雑な姿を描き出しています。

Add Comment