スモールデータとビッグデータの違いとは

更新日

投稿日

 

情報マネジメント

 ビッグデータの活用と声高に叫ばれています。無論、自動的にビッグデータが取れれば多いに越したことはありませんが、スモールデータでも十分に検証できます。

 私は顧客アンケート調査の設計から実査、分析までを頻繁に行っていますが、今回は最適な回収データ数について解説します。

 よく、データを何人取ったら有効でしょうか?と質問を受けます。データはたくさん取った方がいいなど、いろいろな意見が飛び交いますが。データ数50人よりデータ数100人。三桁のデータを扱うことを目標にしましょう。特に根拠はありませんが、調査データが 50人よりは 100人の方がよさそうです。

 100人と200人となると、多い方がいいですが、人数が多くなるとそのための工数や費用が掛かります。そこで、統計解析には誤差を推定することが可能です。この考え方から必要なデータ数を考えて見ましょう。

 統計学の中に少ないデータで全体を推定することができます。その時の前提としては

  • データが少ないと全体の誤差が大きい。
  • データが多いと全体の誤差は少ない。

 ではどの程度でしょうか。比率の誤差は簡便法で 1/ √nで推定できるのです。

 100人の比率の誤差は 最大 10%、400人の比率の誤差は最大 5%、1万人の比率の誤差は最大 1%になります。

 例としてアンケート調査等で回答の比率の結果:男性 50%と結果が出ました。

 その時、100人の場合は ± 10%、400人の場合は ± 5%、1万人の場合は ± 1%。

 100人ですと、± 10%も誤差があるので、問題が出てきます。400人ですと、± 5%の誤差なので、統計でよく使う95%の許容範囲に入ってきます。

 また、アンケート調査の段階評価や得点評価において平均値を使うことも多いでしょう。

 平均値の誤差は、簡便法で 2/ √nで推定できます。

 100人の場合、誤差は ± 0.2点、400人の場合、誤差は ± 0.1点、1万人の場合、誤差は ± 0.02点になります。

 400人ですと、平均値 3.5点の結果は全体では 3.4点 ~ 3.6点 にあることが推...

 

情報マネジメント

 ビッグデータの活用と声高に叫ばれています。無論、自動的にビッグデータが取れれば多いに越したことはありませんが、スモールデータでも十分に検証できます。

 私は顧客アンケート調査の設計から実査、分析までを頻繁に行っていますが、今回は最適な回収データ数について解説します。

 よく、データを何人取ったら有効でしょうか?と質問を受けます。データはたくさん取った方がいいなど、いろいろな意見が飛び交いますが。データ数50人よりデータ数100人。三桁のデータを扱うことを目標にしましょう。特に根拠はありませんが、調査データが 50人よりは 100人の方がよさそうです。

 100人と200人となると、多い方がいいですが、人数が多くなるとそのための工数や費用が掛かります。そこで、統計解析には誤差を推定することが可能です。この考え方から必要なデータ数を考えて見ましょう。

 統計学の中に少ないデータで全体を推定することができます。その時の前提としては

  • データが少ないと全体の誤差が大きい。
  • データが多いと全体の誤差は少ない。

 ではどの程度でしょうか。比率の誤差は簡便法で 1/ √nで推定できるのです。

 100人の比率の誤差は 最大 10%、400人の比率の誤差は最大 5%、1万人の比率の誤差は最大 1%になります。

 例としてアンケート調査等で回答の比率の結果:男性 50%と結果が出ました。

 その時、100人の場合は ± 10%、400人の場合は ± 5%、1万人の場合は ± 1%。

 100人ですと、± 10%も誤差があるので、問題が出てきます。400人ですと、± 5%の誤差なので、統計でよく使う95%の許容範囲に入ってきます。

 また、アンケート調査の段階評価や得点評価において平均値を使うことも多いでしょう。

 平均値の誤差は、簡便法で 2/ √nで推定できます。

 100人の場合、誤差は ± 0.2点、400人の場合、誤差は ± 0.1点、1万人の場合、誤差は ± 0.02点になります。

 400人ですと、平均値 3.5点の結果は全体では 3.4点 ~ 3.6点 にあることが推定できます。

 一方費用の観点で見ると、400人と1万人で人数は 25倍にも関わらず。精度は 5倍しか上がりません。となると、闇雲にデータをたくさん取ると、費用対精度で大きく差が開いてきます。これらの観点で、私はアンケート調査で最適回収データ数は 500人と伝えます。

 

   続きを読むには・・・


この記事の著者

石川 朋雄

日本のものづくりは品質向上に切磋琢磨し,高品質な商品を開発しました。高品質商品と顧客価値創造を融合する商品企画のシステム化を提案します。

日本のものづくりは品質向上に切磋琢磨し,高品質な商品を開発しました。高品質商品と顧客価値創造を融合する商品企画のシステム化を提案します。


「情報マネジメント一般」の他のキーワード解説記事

もっと見る
SNSデータの活用とは データ分析講座(その96)

◆ データの力が政治を動かし始めた時代  今回は「データの力が政治を動かし始めた時代」というお話しです。2018年10月21日の日経新聞の朝刊の一面...

◆ データの力が政治を動かし始めた時代  今回は「データの力が政治を動かし始めた時代」というお話しです。2018年10月21日の日経新聞の朝刊の一面...


データに基づくポリティクスと意思決定 データ分析講座(その171)

  ◆ データに基づくポリティクスと意思決定  前回もお話しましたが、変化が激しく先々の状況が読めないときほど情報を集め、適切な状況判断...

  ◆ データに基づくポリティクスと意思決定  前回もお話しましたが、変化が激しく先々の状況が読めないときほど情報を集め、適切な状況判断...


時系列データを使った予測モデル構築の流れ、データ分析講座(その308)

  時系列データをビジネス活用するとき、最も期待される活用方法の1つが「データで近未来を予測しこれからのビジネス活動に活かす」というもので...

  時系列データをビジネス活用するとき、最も期待される活用方法の1つが「データで近未来を予測しこれからのビジネス活動に活かす」というもので...


「情報マネジメント一般」の活用事例

もっと見る
‐技術開発の目標について 第2回‐  製品・技術開発力強化策の事例(その16)

 技術開発の目標を解説する以下の項目4点について、前回は、1と2を解説しましたので、今回は、第2回として、3と4を記述します。          1....

 技術開発の目標を解説する以下の項目4点について、前回は、1と2を解説しましたので、今回は、第2回として、3と4を記述します。          1....


情報システム導入企業の悩みとは

        今回は、次の事例から、自社の生産システムにあった生産管理ソフトの選択をどうすべきかを解説します。   1. 想定事例  電...

        今回は、次の事例から、自社の生産システムにあった生産管理ソフトの選択をどうすべきかを解説します。   1. 想定事例  電...


ソフトウェア特許とは(その1)

 色々と定義はありますが、ソフトウェア特許とは、よく言うビジネスモデル特許であり、情報システムの特許です。言葉に差はあると思いますが、我々実務家は、ソフト...

 色々と定義はありますが、ソフトウェア特許とは、よく言うビジネスモデル特許であり、情報システムの特許です。言葉に差はあると思いますが、我々実務家は、ソフト...