クリック、購入、嘘、死——あなたの未来を予測するテクノロジーの全貌

予測分析(2016年刊行)は、複雑で魅力的なこの分野への優れた入門書です。データがどのように処理され、人々がより情報に基づいた意思決定を行えるようになるのかを学ぶことができます。この実践は、世界の研究やビジネスの流れを劇的に変えてきました。シーゲルは、マーケティングからヘルスケア、銀行業から人工知能に至るまで、永遠に変わってしまった幅広い領域について、示唆に富む視点を提供しています。

本書の要点——予測分析の基礎を学ぶ

毎日オンライン上で飛び交うデータ量は驚異的です。Facebookで「いいね」を押すこと、オンラインで買い物をすること、広告をクリックすること——そのすべてがデータを生み出します。膨大なデータの海です。あなたの行動をよりよく理解し、影響を与えたいと考える企業や政府にとって、このデータは金鉱に他なりません。

予測分析はリスクを減らし、より安全な判断を可能にする

予測分析(PA)——将来の出来事を予測することに関わる分析分野——を使うことで、企業はあなたが残したデータを活用し、驚くべき精度で将来の行動を予測することができます。しかし、個人の行動を予測する能力が高まるにつれて、重要な道徳的・倫理的問いも浮上します。私たちは自分の未来を予測されることを望むのでしょうか?本書では以下のことを学びます。

  • PAの仕組み
  • IBMのワトソンが人工知能における最大の飛躍である理由
  • PAには偏見が含まれる可能性があること

企業が高額なマーケティングキャンペーンに投資するとき、それは常にリスクを伴います。キャンペーンが失敗し、何百万ドルも無駄になる可能性が常にあるからです。しかし、予測分析を使えば、企業はそのリスクを軽減できます。予測分析(PA)の目的は、人間の行動を研究し、広告を見るなど特定の状況に人々がどう反応するかを把握することです。これは、一般的な行動ではなく、個人の行動を理解することに焦点を当てた、多種多様な統計データと人間の特性を考慮に入れて行われます。つまり、どの広告が最も幅広い層にアピールするかを判断するためにPAを使うのではなく、特定の人々が特定の広告にどう反応する可能性が高いかを判断するために使うのです。より正確に言えば、すべての変数を入力すると、予測スコアが算出されます。

ただし、このスコアは未来を教えてくれるというより、特定の個人の反応がどれだけ起こり得るかを示すものです。例えば、奨学金や補助金を検索しているアメリカの人々が、どのオンライン広告をクリックしたくなる可能性が最も高いかを知りたいとします。年齢、性別、メールのドメインなど、提供する変数が多ければ多いほど、予測スコアはより正確になります。こうした予測スコアは、特定の割引オファーや広告をターゲットにする最適な層を知りたい組織や、どの株を買うべきか、誰を監査すべきかを知りたい組織にとって有用です。

PAで使われる予測モデルは、機械学習に基づいているため、他のモデルよりも動的です。つまり、与えられるデータの種類に基づいて変化し、成長し、適応することができます。また、バックテストを用いるため、他の予測ツールよりも正確です。バックテストとは、過去のデータを使って結果の精度を検証することです。例えば、S&P指数が一年後に上がるか下がるかを予測しようとする場合、バックテストを使えば、1990年の古いデータを入力して、1991年のS&Pについてどれだけ正確かを確認することができます。

予測を行うことは、責任・道徳・偏見の問題を引き起こす

予測目的でテクノロジーを使う能力が向上し、洗練されるにつれて、重要な問いが浮上します。「自分の人生について、どれだけのネタバレを知りたいのか?」そして、より重要なのは、「どれだけの人生を台無しにする覚悟があるのか?」ということです。しかし、これは単に自分の未来を知ることの問題だけではありません。予測分析と、それと密接に関わるデータマイニングにおけるより切実な懸念は、プライバシーです。小売大手ターゲットが、どの顧客が妊娠する可能性が最も高いかをPAで判断していたことが報道で明らかになると、多くの人は同社が行き過ぎていると感じました。

ターゲットは、適切な女性に妊婦向け商品を宣伝したかっただけだと述べましたが、この種のマーケティングは、人々の個人情報を友人や家族、同僚に漏らすリスクを伴います——その人々がまだ共有する準備ができていないかもしれない情報です。しかし、犯罪予防において良いことをする可能性は明らかです。ある企業は、カリフォルニア州サンタクルーズの古いデータをバックテストし、窃盗事件の25%を正確に予測できることを示しました。このようなシステムは、警察が毎日巡回できるさまざまな「ホットスポット」を特定するのに役立ちます。シカゴ、メンフィス、ロサンゼルスなどの大都市では、犯罪率を減らすためにPAを活用しています。過去や現在の犯罪、その犯罪を取り巻く状況(曜日、祝日かどうか、天気など)を含む多様なデータを使用しています。

しかし、繰り返しになりますが、使用されるデータは行き過ぎではないかと感じる人もいます。特に、他人の行動に基づいて一個人の行動を推測する場合はそうです。例えば、一部の都市では、受刑者が犯罪に戻る可能性を判断するためにPAを使用しています。そして多くの人々は、これがPAモデルに偏見が入り込む扉を開くと考えています。例えば、同じ犯罪を犯した二人の犯罪者がいて、両方とも仮釈放を申請しているとします。しかし、そのうちの一人は犯罪率の高い郵便番号の地域出身だとします。

その郵便番号の犯罪率のため、その犯罪者は犯罪の人生に戻る可能性が高いと判断されるでしょう。これは明らかに偏見に基づく予測であり、選挙権を奪われたマイノリティ層が多い都心部の地域は犯罪率が高い傾向があるため、そうした地域の人々が最も苦しむことになります。要するに、これは人種プロファイリングの別の形に過ぎないのです。

データは常に予測的であるが、精度にはバランスの取れたデータ量が必要

現在、データは貴重で不可欠なビジネス資産であり、私たちは毎日ますます多くのデータを生み出しています。予測分析における哲学は「データは多ければ多いほど良い——ただし、バランスが取れている限り」というものです。つまり、使用するデータを選択的にし、各タイプを均等に追加する必要があるということです。ある種のデータは、私たちの日常的なタスクや行動に関連するもので、電話記録、銀行取引、オンライン購入などから取得できます。

この種のデータはPAモデルでよく使われるほか、個人のソーシャルメディアやブログの履歴も使われます。毎日推定86万4千件のブログ投稿があり、それらは基本的に個人の私的な思考を公開データに変えています。2011年時点で、WordPressとTumblrだけで1億の個人ブログがありました。膨大なデータです。実際、1986年にコンピューターに保存されていたすべてのデータを両面印刷すると、地球上の全陸地を覆うのに十分な紙の量になります。しかし2011年には、地球全体を本2冊分の厚さで覆うことができるでしょう!

このデータの豊富さが分析をこれほど洗練されたものにしている一方で、バランスが取れていない場合には、より多くの潜在的なミスにもつながります。データが増えると、ランダムな出来事が意味のあるものと誤認される可能性も高くなります。PAで発生するエラーのほとんどは、ある領域の変数が多すぎて誤った相関関係を生み出すことが原因ですが、これはバランスの取れたデータセットを作成することで回避できます。通常は、より多くのデータを追加することを意味します。例えば、PAを使ったある研究によると、オレンジ色に塗られた車を買えば「レモン」(欠陥車)を買う可能性が低くなるとされています。これは明らかにナンセンスですが、データはそれを裏付けていました。問題は、データのバランスを取るのに十分な自動車販売データがなかったことで、データを追加すると、塗装の色が欠陥車を買う可能性とは無関係であることが明らかになりました。

機械学習は見落とされるリスクを発見できるが、機械学習自体にもリスクがある

見てきたように、予測分析は機械学習の恩恵を受けており、時間の経過とともにモデルはより正確な予測ができるようになります。しかし、機械学習にはもう一つ非常に重要な利点があります。それは、偽装されたリスク、つまり「ミクロリスク」を認識する能力です。偽装されたリスクはビジネスにおいて一般的な危険です。それらは、大きな問題に積み重なるまで、見逃しやすい、あるいは無視しやすい小さな損失である傾向があります。

例えば、チェース銀行が住宅ローンの支払いに関する長期的な予測を行うためにPAを使い始めたとき、顧客に前払いや早期返済をさせることで、どれだけの将来の利息を逃していたかに気づきました。これらの支払いは最初は小さな損失に見えましたが、予測収益に合算すると、痛々しいほど大きな問題になりました。予測分析と機械学習により、コンピューターは文字通り自らをプログラミングします。どんな細部も検討から漏れることはありません。その結果、モデルは常に長期的な影響を考慮するため、ミクロリスクも見逃されることはありません。これにより、チェースのような組織は手遅れになる前に対処する機会を得られます。

これが、現在銀行が住宅ローンに関連するすべての小さなリスクを捕捉するためにPAを使用している理由です。しかし、分析の世界では、学び過ぎるということも確かに存在し、それは一種類のデータが多すぎることに似た問題です。過学習は誤った予測につながる可能性があるからです。バークレー校のある教授は、かつてこのことを示す素晴らしい例を提示しました。それは「株式市場はバングラデシュのバター生産量と同じパターンに従う」という奇妙な主張を裏付けるデータでした。機械の過学習に対する解決策は、非常に人間的なものです。つまり、機械に間違いを犯させ、そこから学ばせ、次に誤った関連性が現れたときにそれを認識できるようにすることです。

複数のソースとモデルを組み合わせることで精度とパフォーマンスが向上する

志を抱くアーティストや起業家と同様に、予測分析もクラウドソーシングの恩恵を受けてきました。一般大衆の集合知に開かれることで、PAはアンサンブルモデリングの恩恵を享受することができました。アンサンブルモデルとは、組み合わせ予測モデルのことで、クラウドソーシングコンテストが促進する競争と協力の環境を通じて開発されました。マッキンゼーのレポートによると、PAの労働力には分析スキルが著しく不足しています。

実際、2018年までに、米国では深い分析スキルを持つ人材が14万人から19万人不足する可能性があります。この不足に鑑み、企業は目標を達成し、新しい人材を発見するためにクラウドソーシングに目を向けています。「アンサンブルモデルの夜明け」と広く考えられているのは、2008年にNetflixが推薦システムの精度を10%向上させるためのクラウドソーシングコンテストを開始したときです。コンテストの最終段階では、20人以上のメンバーからなる2つの大きなチームが合流し、同様に2つの非常に強力な予測モデルも合流しました。どちらもNetflixの目標を達成しました。これは、チャレンジ中に作られた友好的な競争環境によって可能になりました。コンテストには、新しいアイデアの共有と継続的なオープンな対話を促進するオンラインフォーラムが含まれていました。

それ以来、アンサンブルモデルは単一モデルを日常的に凌駕しています。研究によると、単一モデルからアンサンブルモデルに移行することで、パフォーマンスは5〜30%向上します。さらに、アンサンブルモデルは、より多くのモデルが統合されるにつれて改善し続けることが示されています。この全般的な改善はアンサンブル効果として知られるようになり、ますます複雑な問題に取り組むために使用されています。現在、アンサンブルモデルを使用している組織には、税務詐欺を発見する方法としてのIRS(米国国税庁)、寄付額を予測するネイチャー・コンサーバンシー、通話の切断を減らすノキア・シーメンス、不正な政府請求書を発見する米国国防総省などがあります。

人間の言語は困難な課題をもたらすが、大きな進歩がすでに達成されている

アンサンブルモデルの能力向上は、機械が自然言語を処理する能力など、非常に複雑なプロジェクトに活用されています。計算言語学を含むプロジェクトにおける最大の課題の一つは、人間の音声に含まれるあらゆる微妙なニュアンスを捉えることです。二人の人が会話するとき、そこには様々な複雑な要因が働いており、それぞれが話されている内容の真の意味を決定するのに役立っています。例えば、二人の人が「これは素晴らしい」と言っても、一人は皮肉を込めて言うかもしれないので、もう一人とは正反対の意味になり得ます。

それでも、テキストデータは全データの80%を構成すると考えられています。ですから、テキストを理解することは、PAにとって最大の機会であると同時に、最大の課題でもあります。このハードルを乗り越える最大の飛躍の一つは、2011年にIBMがクイズ番組ジェパディ!で人間と競うために設計されたプログラム、ワトソンを開発したことです。IBMは、数十年分の古いジェパディ!のエピソードを含む膨大なテキストデータを使用してワトソンを作成しました。

本当の課題はデータをどのように処理するかであり、その答えはアンサンブルモデルにありました。IBMは基本的に、人間の言語処理に関する既存の最新モデルをすべて組み合わせました。それぞれが独自の欠点を持っていましたが、組み合わされることで、自然言語を処理する能力を持つ強力な全体となりました。2011年2月14日、ワトソンは競争相手を圧倒しました。この場合の競争相手は二人の元ジェパディ!チャンピオンであり、これはおそらく人工知能における最大の単独の進歩でした。他のPAモデルとは異なり、ワトソンは将来の結果を予測するためではなく、可能性を排除し、質問に対する最も可能性の高い答えを予測するために構築されました。

そしてワトソンは、Googleや現在利用可能な他のどのインターネット検索エンジンよりも優れてこれを行いました。ワトソンのテクノロジーは現在、金融および医療診断を行うために作り変えられています。そして、その影響はAppleのSiriプログラムにも見ることができます。Siriはスマートフォンユーザーの簡単な質問に答えるように設計されています。しかし、正直なところ、iPhoneユーザーなら誰でも、Siriがジェパディ!ではあまり上手くいかないことを知っています。

予測分析は説得を定量化することで、知覚できないものを特定できる

携帯電話会社や債権者からのスパムにうんざりしていませんか?良いニュースは、予測モデリングの進歩により、企業はどの人が一方的な広告を受け入れやすく、どの人は放っておくのが最善かを知ることができるようになったことです。対象オーディエンスを困らせて製品やサービスを避けさせたい企業はないので、微妙に説得力がある必要があります。これが予測分析の技術が向かっている方向です。その最良の例の一つが、ノルウェーの通信会社テレノールです。

テレノールは、ターゲット顧客に連絡するとき、意図しない結果を伴って他の人々にも届いていることを発見しました。具体的には、テレノールは、サービスの切り替えリスクがあると見なされる顧客に連絡すると、切り替えリスクがないと見なされる顧客にも届いていることを発見しました。そして、これを行うことで、テレノールは実際に彼らを切り替えリスクのある顧客に変えてしまっていたのです。これはPA業界が直面する別の問題を提起します。「同じメッセージに対して、ターゲットにされた人とターゲットにされなかった人がどう反応するかを同時に予測することは可能か?」という問いです。この問いがアップリフトモデルをもたらしました。これは、説得という知覚できない性質を考慮に入れるモデルです。アップリフトモデルは2つのデータセットで設計されており、2つの異なる顧客をターゲットにして次の質問をします:「どのターゲットオーディエンスが最も説得されるか?」

通常、シナリオの一つはコントロールセットであり、例えば誰にも連絡しないというものです。このように、アップリフトモデルは、参加者の一部にプラセボを与えて、他のすべてを測定するためのベースライン結果を得る医療試験に似ています。説得の量を測定することに加えて、アップリフトモデルは、わざわざ連絡する必要のない人も教えてくれます。例えば「確実な人」——追加の説得を必要としない人々、そして「邪魔しないでほしい人」——決して説得されない人々です。このモデルは、USバンク、フィデリティ、テレノールなどの企業で驚異的な効果を発揮し、マーケティングの効果を最大36%も向上させました。アンサンブル効果と並んで、アップリフトモデルは予測分析がどのように成長してきたかを示す好例であり、一見解決不可能に見える問題を克服できることの証です。

最終まとめ

本書の核心となるメッセージ:予測分析があなたの日常生活に与える大きな影響に気づいていないかもしれませんが、それはほぼあらゆるところに存在します。それはテクノロジーがあなたと関わる方法に影響を与えるだけでなく、現在の技術進歩の多くを推進する原動力でもあります。今日の世界でどのようなイノベーションが起きているのかを知りたければ、予測分析に精通しているべきです。ご意見をお待ちしています!

本書の内容についてのご意見をお聞かせください!この本のタイトルを件名にして、[email protected]までメールでご感想をお寄せください。さらに読み進めるのにおすすめ:『Algorithms to Live By』(ブライアン・クリスチャン&トム・グリフィス著)『Algorithms to Live By』(2016年刊行)は、アルゴリズムが日常生活と想像以上に関係していることを示す実用的で有益なガイドです。それだけでなく、問題解決や意思決定、より多くのことを成し遂げるのに役立ち、より良い人生へと導いてくれます。

Add Comment