機械学習がデータ漏洩検知を支える
目次
データサイエンスは、CybelAngelのデータ漏洩検知において重要な歯車です。当社の機械学習モデルは、CybelAngelのセキュリティアナリストの専門知識を補強することで、データ侵害から顧客を保護します。人間によるソリューションだけでは、Web上でやり取りされるデータの爆発的な増加によって生成されるすべての誤検知の中から実際の漏洩を検知するのに膨大な時間がかかります。. 効率的な機械学習モデルにより、真の偽陽性と潜在的脅威の効果的なトリアージが可能になります。これにより、アナリストが調査しなければならないアラートの全体的なフィードが削減されます。. しかし、どうすれば人間のように振る舞う数学モデルを訓練できるのでしょうか。それは、訓練と再訓練を繰り返すことによってです。. どうやるか見てみよう。.
トレーニングセッションの準備
CybelAngelでは、「安全な」データと「外部に出るべきではない」データを見分けるモデルを構築しています。これは、「重要ではない」というネガティブクラスと、「重要な文書」というポジティブクラスの2つのみを持つ分類タスクです。“ 本番のトレーニングを始める前に、データセットの準備をします。データのクレンジング、つまり重複データの削除やアンダーサンプリングを行い、これで準備完了です! データセットはその後、同様に分布させるために必要なすべてのチェックを経て、訓練、テスト、検証のサブセットに分割されます。また、特徴量の探索を行い、使用する特徴量を選択しました。. それではトレーニングのフェーズに進むことができます。これは5つの主要な要素に分かれています。これらのステップは順序通りである必要はなく、すべてのステップを完了させさえすれば、プロセスのどの時点からでも始めてモデルを調整することができます。.
#1 – アルゴリズムのベンチマーク
機械学習モデルの構築は、適切なアルゴリズムを選択することから始まります。ニューラルネットワーク(NN)を使用することもできますが、優れた標準モデルを使用することも可能です。NNはトレンドであり、より優れた学習器として紹介されることが多いですが、ランダムフォレスト分類器(RFC)、ロジスティック回帰(logreg)、さらにはk近傍法(kNN)などの他のアルゴリズムと比較してみる価値はあります。CybelAngelでは、データサイエンティストがこれらすべてのアルゴリズムを活用し、データセットに合わせてアプローチを適応させています。. 私たちのターゲット?それは解釈可能性と頑健性です。データが毎月変化するため、これは非常に重要です!
#2 – ハイパーパラメータの選択
ほとんどのモデルがアルゴリズムを完成させるにはハイパーパラメータを必要とします。ハイパーパラメータの微調整における難しい点は、過学習に陥りやすいということです。. 良い例として、私たちのモデルの一つにRFCを使用していることが挙げられます。このモデルは 過学習. なぜか?RFCは木ベースのアンサンブル法だからです。木の深さをどこまで許容するか、1つの葉がどれだけのデータを含まなければならないかを選択する必要があります。葉ごとのインスタンス数がわずかになるまで分岐を続けさせると、訓練データから未知データへの汎化能力がないモデルを作り上げてしまうことは確実です。. 私たちの目標は?汎用性を備えた最適な適合度です。.
#3 – 標本重み付け法の実装
CybelAngelでの私たちの分類の目標は リスク検出, 、つまりすべての文書が同じ重要度を持つわけではありません。請求書が野放しになるのは厄介ですが、本社の設計図がダークウェブのフォーラムで売買されるようなことになれば、ビジネスにとって致命的になり得ます! CybelAngelの分類は、厄介なリスクと、ビジネスに大混乱をもたらしかねないリスクを区別します。当社は学習インスタンスに異なるサンプル重みを割り当てます。データ侵害の深刻度が高いほど、アルゴリズムがそれを適切に分類できるように学習することが重要になります。. 私たちの目標:データの重要度(深刻度)のレベルに応じて、各データタイプに係数を割り当てること。.
#4 – 学習曲線の活用
十分なデータとはどのくらいの量なのかについては、常に議論が絶えません。モデルの品質と堅牢性を確保するには、どのくらいのデータがあれば十分なのでしょうか。私たちの友人には 学習曲線! 学習曲線は、データセットのサイズに応じた特定のマトリクスにおけるモデルのパフォーマンスを表します。テストセットでのパフォーマンスは向上し、トレーニングセットでのパフォーマンスは低下します。これは、トレーニングの汎化を表しています。テストセットでのパフォーマンスの向上が止まり、トレーニングセットでのパフォーマンスに近づいたら、それでおしまいです!一般的なモデルを構築するのに十分なデータがあると言えます。. 学習曲面は、オーバーフィッティング(過学習)またはアンダーフィッティング(未学習)の状態にあるかどうかをも教えてくれます。それは「どれくらいうまく学習できているか」、つまりモデルが本番環境へ移行する準備ができているかどうかを教えてくれるものです。もしオーバーフィッティングしているのであれば、ハイパーパラメータの微調整に戻りたいと思うかもしれません。.
#5 – 機械学習モデルの再学習
モデルは長期間にわたって最適状態を維持することはありません。データや行動は絶えず変化します。. オンライン学習は、最先端を維持し、モデルが訓練されたデータと処理するデータの間の一貫性を保つための解決策の一つです。そのアイデアは、モデルの予測からフィードバックを得て、そこから学習させることです。. CybelAngelでは、データサイエンスチームがサイバーアナリストと密接に連携しています。最後のフィルターにより、人間の専門知識を用いたモデルの検証が可能になります。サイバーアナリストがインスタンスを分類し、データサイエンティストはそのフィードバックを活用してモデルを更新し、精度を維持します。. CybelAngelでは、潜在的な情報漏洩に対処するサイバーアナリストの行動を模倣するように機械学習モデルをこのようにトレーニングしています。しかし、機械学習モデルが人間の調査に取って代わるわけではありません。それは人間の調査を強化するだけでしかありません。何十億もの真の陰性(問題なし)を整理することで、これらのモデルは、サイバーアナリストが誤検知ではなく重大な脅威に時間とスキルを集中させられるようにします。. 機械学習と人間の専門知識のこのユニークな組み合わせこそが、CybelAngelが世界中の企業に対して、包括的で拡張性があり、実行可能なカバレッジを提供することを可能にしています。.
