このページでは

For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.

Amplitude Analyticsでのデータのプルーニングと順序付け

データ分析において、データプルーニングとは、無関係なデータ、冗長なデータ、または価値の低いデータを取り除くことで、データセットのサイズを削減するプロセスを指します。データプルーニングの目的は、データセットを合理化し、それをより管理しやすく、効率的で、分析にとって有意義なものにすることです。

順序付けは並べ替えとも呼ばれますが、1つ以上の基準に基づいてデータを特定の順序に並べ替えるプロセスを指します。順序付けされたデータを使用すると、データセット内のパターン、傾向、関係性を簡単に識別できます。

この記事では、Amplitude Analyticsがどのようにチャートのプルーニングと順序付けを実行しているかを説明します。

Amplitude Analyticsがデータをプルーニングおよび順序付けする理由

Amplitude Analyticsは、group-by句が過剰な数の値を返すたびに、チャートのデータに対してプルーニングおよび順序付けを行います。ユーザーIDごとにグループ化されたチャートを想像してください。これらは異なる値であるため、このクエリは分析対象のセグメント内のすべてのユーザーIDを返します。これらの値をすべて1つのチャートに含めると、読み取りが困難になり、そこから価値を得ることはほとんど不可能になります。

このような場合にチャートのパフォーマンスを維持するために、Amplitudeはチャートから値を切り取りします。1つのgroup-by句を持つチャートの場合、最大100個の値を表示できます。2つのgroup-by句を持つチャートの場合、最大500個の値を表示できます。

グループ化基準と、それがプルーニングと順序付けにどのように影響するかについて詳しくご覧ください。

Amplitude Analyticsはまた、上位値のみを表示することでチャート結果を順序付けします。アナリティクスは、グラフの時間枠内のユーザーアクティビティを比較して、どの値が上位値であるかを判断します。

たとえば、過去30日間のユーザー数を表すチャートと、過去7日間のユーザー数を表す別のチャートがあるとします。定義上、アクティブな上位ユーザーは他のユーザーよりも頻繁にイベントをトリガーしています。 そのため、これらの各期間において上位ユーザーは異なる可能性があります。これは、7 日間の期間における上位アクティブユーザーは、30 日の期間において(全体的にまたはその規模の大きいユーザー集団内の他のユーザーと比較して)アクティブ性が低い可能性があるためです。

Amplitude Analyticsは、チャートに他のフィルターを適用する前に結果をプルーニングします。これにはコホートが含まれます。

プルーニング後の結果を表示する

チャートから整理されたクエリ結果を表示するには、いくつかの方法があります。

  • より多くのフィルターを適用する:これにより結果のプールが絞り込まれ、表示したい値がより多く表示されます。
  • 結果をエクスポートする:.CSVをダウンロード(最大10,000個の値)するか、Dashboard REST API(最大20,000個の値)を使用します。
  • データテーブルで1つの列を使用する:データテーブル内のプロパティごとにグループ化する場合、1つのグループ化基準列(複数ではなく)を使用すると、最も完全な結果セットが得られます。単一列の場合、Amplitudeは近似値ではなく実際のメトリックを使用してランク付けできます。

グラフ固有の考慮事項

イベントセグメンテーション

  • イベントセグメンテーションチャートで[ユニーク]タブを表示するとき、すべてのユーザーが1回だけ表示されます。表示すべき上位ユーザーはいません。

ファネル分析

  • Amplitude Analyticsがファネル分析チャート上のユーザーをプルーニングした場合、コンバージョン率はが予想よりも高く見える可能性があります。これは、ユーザーが少ないためです。

永続的なプロパティまたはアトリビューションを持つデータテーブル

データテーブルに永続的なプロパティやアトリビューションメトリック(ラストタッチなど)が含まれている場合、ランキングのロジックは標準的なグループ化基準とは異なるため、結果が違和感のあるものになる可能性があります。

**標準ランキングの仕組み:**標準メトリック(ユニーク数や合計数など)を持つ単純なグループ化基準の場合、Amplitudeは表示されるメトリックと同じメトリックを使用してグループをランク付けします。上位100行は、あなたが関心のあるメトリックにおける真の上位100行です。

**永続化されたプロパティとアトリビューションにおけるランキングの仕組み:**ラストタッチのクレジットを割り当てたり、ユーザーのイベント履歴全体にわたって永続化されたプロパティを解決したりするなど、実際のコンピューテーションを実行するとコスト高になります。Amplitudeは、どの値を保持するかを決定するためだけにそれを実行する余裕はありません。その代わりに、Amplitudeはより安価なプロキシを代用します。それは、「すべてのイベント」に関する単純なイベントセグメンテーションを使用してグループを合計でランク付けし、「すべてのイベントで最も頻繁に表示されるプロパティ値はどれですか?」と尋ねます。「実際のメトリックでどの値が最も高いか?」というよりは、

つまり、Amplitudeが保持する値は、期待した値とは異なる場合があります。 Amplitudeは、実際のメトリックで上位にランク付けされているプロパティ値を除外する場合があります。これは、これらの値はすべてのイベントで一般的ではないためです。一方で、一般的ですが値の低いグループが含まれることもあります。

実務上の影響:

  • Amplitudeが結果セットから値の高い行を削除した場合、合計が予想よりも少なく表示されることがあります。
  • 列の順序を変更すると(別の列でソート)、再計算が発生し、異なる行が表示される可能性があります。 このような動作になりますので、あらかじめご了承ください。
  • Amplitudeが何をプルーニングしたのかを正確に確認することはできません。プルーニングされた値を識別するには、プルーニングによって回避されるすべてのコンピューテーションを実行する必要があります。

最も完全な結果を得る

永続的なプロパティやアトリビューションメトリックを扱う際には、データテーブルで1つの列(1つのグループ化基準)を使用します。1つの列を使用することで、Amplitudeはプロキシではなく実際のメトリックを使用してランキングを行うことができ、これにより最も正確で完全な結果セットが得られます。

これは役に立ちましたか?