分析データの粒度はより細かく データ分析講座(その164)

更新日

投稿日

データ分析

 

◆ 分析は最終的かつ不可逆的なもの

 蓄積され続けてはいるけど、人手にあまり触れられていないデータの中には、データの粒度がバラバラなケースが多々みられます。そのようなデータを相手に集計や分析を行うと非常に苦労します。ちなみに、データの粒度とはデータの細かさの程度をいいます。分かりやすくお話すると時間やカテゴリー、エリアなどです。例えば時間の粒度がバラバラとは、あるデータは日単位で、あるデータは月単位であるということです。

 カテゴリーの粒度がバラバラとは、エリアや時期によってデータとして蓄積されているカテゴリーが異なったり(ある時期は大カテゴリーまでのデータしかない、など)、カテゴリーの分け方(考え方)が異なるということです。

 今回は「分析は最終的かつ不可逆的なので、データの粒度はより細かく」というお話しをします。

【目次】

  1. 加工は「不可逆的」
    (1)粗い粒度を細かくできない
    (2)モデルを構築した時、使用した学習データは、モデルからは分からない
    (3)覆水盆に返らず
  2. データの粒度はより細かく蓄積しておこう
  3. 今回のまとめ

 

1. 加工は「不可逆的」

 不可逆的とは、加工する(手を加える)と元に戻せない性質のことを意味します。例えば、工場で物を生産するとき、機械などで加工しますが、一度材料などに手を加えると元の状態に戻すことができなくなります。データの集計や分析なども同様です。

(1)粗い粒度を細かくできない

 1日単位のデータを1ケ月単位に集計するなど、細かい粒度のデータを粗くすることは可能です。しかし逆は非常に難しくなります。要するに、粗い粒度を細かくできないのです。

(2)モデルを構築した時、使用した学習データは、モデルからは分からない

 データ分析・活用をビジネスで実施しようとする時、異常検知や予測モデルなどを構築することはあります。これらモデルを構築するためにはデータが必要になります。そのようなデータを、学習データといいます。当然ですが、モデルを構築した時に使用した学習データは、モデルからは分かりません。

(3)覆水盆に返らず

 データ分析も最終的かつ不可逆的なため、後から粒度の粗いデータを細かくできないし、構築されたモデルから学習データを作ることはできません。要するに「覆水盆に返らず」です。もし、データの粒度が粗い状態で蓄積されていたら最終的かつ不可逆的と諦(あきら)め、その範囲でどうにかして、データ分析・活用をしなければなりません。

 ブラックボックス化された異常検知や予測モデルなどを使うのであれば最終的かつ不可逆的と諦め、その状態でデータ分析・活用をしなければなりません。つまり、取り返しがつかないということです。ここで悩んでも仕方がないので、現状でどうにかする必要があります。さらに、今後悩まないように、データ分析も最終的かつ不可逆的であることを前提に、データ分析・活用を考えていく必要はあります。

 

2. データの粒度はより細かく蓄積しておこう

 可能ならば、データの粒度はより細かく蓄積しておいたほうがいいでしょう。

 今不必要な粒度でも、将来必要な粒度になることはあります。また、利用している数理モデルを構築した時の学習データなども残しておきましょう。その時学習データだけでなく、どのように学習させたかという条件設定や、そこに至るまでのフローなども残しておいたほうがいいでしょう。残念なことに、数理モデルを構築したときの学習データと思われるもので、数理モデルを再構築したのに再現できない、ということがたまにあります。

 

3. 今回のまとめ

 今回は「データの粒度はより細かく、なぜならばデータ分析は最終的かつ不可逆的だから」というお話しをしました。

 それなりのデータ分析をしたことのないデータの場合、データの粒度がバラバラで苦労することがあります。データの粒度とは、文字通りデータの細かさの程度をいい、時間やカテゴリー、エリアなどです。例えば、1日単位のデータを、...

データ分析

 

◆ 分析は最終的かつ不可逆的なもの

 蓄積され続けてはいるけど、人手にあまり触れられていないデータの中には、データの粒度がバラバラなケースが多々みられます。そのようなデータを相手に集計や分析を行うと非常に苦労します。ちなみに、データの粒度とはデータの細かさの程度をいいます。分かりやすくお話すると時間やカテゴリー、エリアなどです。例えば時間の粒度がバラバラとは、あるデータは日単位で、あるデータは月単位であるということです。

 カテゴリーの粒度がバラバラとは、エリアや時期によってデータとして蓄積されているカテゴリーが異なったり(ある時期は大カテゴリーまでのデータしかない、など)、カテゴリーの分け方(考え方)が異なるということです。

 今回は「分析は最終的かつ不可逆的なので、データの粒度はより細かく」というお話しをします。

【目次】

  1. 加工は「不可逆的」
    (1)粗い粒度を細かくできない
    (2)モデルを構築した時、使用した学習データは、モデルからは分からない
    (3)覆水盆に返らず
  2. データの粒度はより細かく蓄積しておこう
  3. 今回のまとめ

 

1. 加工は「不可逆的」

 不可逆的とは、加工する(手を加える)と元に戻せない性質のことを意味します。例えば、工場で物を生産するとき、機械などで加工しますが、一度材料などに手を加えると元の状態に戻すことができなくなります。データの集計や分析なども同様です。

(1)粗い粒度を細かくできない

 1日単位のデータを1ケ月単位に集計するなど、細かい粒度のデータを粗くすることは可能です。しかし逆は非常に難しくなります。要するに、粗い粒度を細かくできないのです。

(2)モデルを構築した時、使用した学習データは、モデルからは分からない

 データ分析・活用をビジネスで実施しようとする時、異常検知や予測モデルなどを構築することはあります。これらモデルを構築するためにはデータが必要になります。そのようなデータを、学習データといいます。当然ですが、モデルを構築した時に使用した学習データは、モデルからは分かりません。

(3)覆水盆に返らず

 データ分析も最終的かつ不可逆的なため、後から粒度の粗いデータを細かくできないし、構築されたモデルから学習データを作ることはできません。要するに「覆水盆に返らず」です。もし、データの粒度が粗い状態で蓄積されていたら最終的かつ不可逆的と諦(あきら)め、その範囲でどうにかして、データ分析・活用をしなければなりません。

 ブラックボックス化された異常検知や予測モデルなどを使うのであれば最終的かつ不可逆的と諦め、その状態でデータ分析・活用をしなければなりません。つまり、取り返しがつかないということです。ここで悩んでも仕方がないので、現状でどうにかする必要があります。さらに、今後悩まないように、データ分析も最終的かつ不可逆的であることを前提に、データ分析・活用を考えていく必要はあります。

 

2. データの粒度はより細かく蓄積しておこう

 可能ならば、データの粒度はより細かく蓄積しておいたほうがいいでしょう。

 今不必要な粒度でも、将来必要な粒度になることはあります。また、利用している数理モデルを構築した時の学習データなども残しておきましょう。その時学習データだけでなく、どのように学習させたかという条件設定や、そこに至るまでのフローなども残しておいたほうがいいでしょう。残念なことに、数理モデルを構築したときの学習データと思われるもので、数理モデルを再構築したのに再現できない、ということがたまにあります。

 

3. 今回のまとめ

 今回は「データの粒度はより細かく、なぜならばデータ分析は最終的かつ不可逆的だから」というお話しをしました。

 それなりのデータ分析をしたことのないデータの場合、データの粒度がバラバラで苦労することがあります。データの粒度とは、文字通りデータの細かさの程度をいい、時間やカテゴリー、エリアなどです。例えば、1日単位のデータを、1ケ月単位に集計するなど、細かい粒度のデータを粗くすることは可能です。データ分析は最終的かつ不可逆的なため、集計したものや構築したモデルから元データを得ることはできません。

 実際に、1ケ月単位のデータを、1日単位のデータにすることは、非常に無理があります。もし、データの粒度が粗い状態で蓄積されていたら最終的かつ不可逆的と諦め、その範囲でどうにかし、データ分析・活用をしなければなりません。ブラックボックス化された異常検知や予測モデルなどを使うのであれば最終的かつ不可逆的と諦め、ブラックボックス化された状態でデータ分析・活用をしなければなりませんので、その現状でどうにかする必要があります。

 さらに今後悩まないよう、データ分析も最終的かつ不可逆的であることを前提に、データ分析・活用を考えていく必要があります。可能ならば、データの粒度はより細かく蓄積しておいたほうがいいでしょう。

 

 次回に続きます。

   続きを読むには・・・


この記事の著者

高橋 威知郎

データネクロマンサー/データ分析・活用コンサルタント (埋もれたデータに花を咲かせる、データ分析界の花咲じじい。それほど年齢は重ねてないけど)

データネクロマンサー/データ分析・活用コンサルタント (埋もれたデータに花を咲かせる、データ分析界の花咲じじい。それほど年齢は重ねてないけど)


「情報マネジメント一般」の他のキーワード解説記事

もっと見る
CRM(顧客関係管理システム)とは データ分析講座(その39)

◆ CRMのデータ分析をダメにする〇〇管理という合言葉、すぐできる解決策とは?  CRM(顧客関係管理システム)などでやたらと出てくる言葉に、「〇〇...

◆ CRMのデータ分析をダメにする〇〇管理という合言葉、すぐできる解決策とは?  CRM(顧客関係管理システム)などでやたらと出てくる言葉に、「〇〇...


ビジネス インテリジェンス ツール データ分析講座(その282)

  私は仕事柄、幸運にもあるものを見せられることが度々あります。ある人は自慢げに、ある人は不安げにあるものを見せて語ってくれます。そのある...

  私は仕事柄、幸運にもあるものを見せられることが度々あります。ある人は自慢げに、ある人は不安げにあるものを見せて語ってくれます。そのある...


収益につながるデータ分析 データ分析講座(その6)

  ◆ データが無いと思ったらあったので、取引拡大に利用してみた  「ビッグデータ、ビッグデータと言うけど、うちの会社にデータと言えるよ...

  ◆ データが無いと思ったらあったので、取引拡大に利用してみた  「ビッグデータ、ビッグデータと言うけど、うちの会社にデータと言えるよ...


「情報マネジメント一般」の活用事例

もっと見る
‐社内の問題克服による開発活動‐  製品・技術開発力強化策の事例(その14)

 前回の事例その13に続いて解説します。社内における様々な問題を高いレベルで深く追及して解決することが、競争力のある技術を育成し、売れる製品を生み出す事に...

 前回の事例その13に続いて解説します。社内における様々な問題を高いレベルで深く追及して解決することが、競争力のある技術を育成し、売れる製品を生み出す事に...


現場情報の自動収集に道具だてを

 一日の作業指示の出し方で、次のどちらの組織の管理レベルの改善がより進むでしょうか?        ・A社 ➡「x製品を◯個」     ・B...

 一日の作業指示の出し方で、次のどちらの組織の管理レベルの改善がより進むでしょうか?        ・A社 ➡「x製品を◯個」     ・B...


人的資源マネジメント:製品開発の滞留を引き起こすファイルとは(その2)

 今回は、PDM/PLMに代表される製品開発業務のIT化をどのように考え、進めるのがよいのかについて解説します。    前回まで続けていたテ...

 今回は、PDM/PLMに代表される製品開発業務のIT化をどのように考え、進めるのがよいのかについて解説します。    前回まで続けていたテ...