医療職からデータサイエンティストへ

統計学、機械学習に関する記事をまとめています。

度数と階級とは?~森の統計辞典~

度数と階級とは? まとめます 度数とは? 階級とは? 次に読む おすすめ参考書など 度数と階級とは? 度数とは、データを区切ったグループの中にいるデータ数のことです。また、そのグループのことを階級と呼びます。 森のうさぎを100羽連れてきて、体の大き…

箱ひげ図と外れ値~森の統計辞典~

外れ値とは? 箱ひげ図と外れ値 まとめます 外れ値とは? 箱ひげ図と外れ値 おすすめ参考書など 外れ値とは? 外れ値とは、他のデータよりも明らかに外れた値を持つデータのことを指します。 外れ値を判断するための基準はいくつかありますが、四分位数と箱…

箱ひげ図とは?~森の統計辞典~

箱ひげ図とは? 箱ひげ図の見方 まとめます 箱ひげ図とは? 次に読む おすすめ参考書など 箱ひげ図とは? 四分位数を見やすくグラフにしたものです。 www.medi-08-data-06.work 森からうさぎを40羽連れてきて、次のステップで箱ひげ図を作成します。 うさぎ…

四分位数(quantile)とは?~森の統計辞典~

四分位数(quantile)とは? 四分位数の呼び名 まとめます 四分位数とは? 次に読む おすすめ参考書など 四分位数(quantile)とは? 四分位数とは、データを大きさの順に並べて、個数を4等分できる値のことです。 森からうさぎを40羽連れてきて、体の大きさ順…

分散、標準偏差とは?~森の統計辞典~

分散とは? 分散の計算方法 標準偏差とは? まとめます 分散とは 標準偏差とは おすすめ参考書など 分散とは? 分散とはデータのばらつきの(2乗)平均値です。平均値から離れたデータが多いほど、分散は大きくなります。 www.medi-08-data-06.work 森のうさ…

平均値(mean)、中央値(median)、最頻値(mode)とは~森の統計辞典~

平均値とは 中央値とは 最頻値とは まとめます 平均(mean)とは 中央値(median)とは 最頻値(mode)とは 次に読む おすすめ参考書など 平均値とは 全てのデータの値を足して、データの数で割った値のことです。 森に住む10匹のうさぎの体重を測定したとします。…

pythonで層別、グループ別グラフを作成する

データの可視化をする上で、性別ごとのヒストグラムや、年代ごとの折れ線グラフなど、ある特定の層やグループごとに色分けをしてグラフをかくことがあります。今回は、簡単にグループごとの色分けグラフを書くための、2つの方法をご紹介します。 積み上げ棒…

そろそろ覚えるRで縦持ち横持ち変換〜pivlot_loger、pivot_wider〜

R

Rでテーブルを縦持ち、横持ちに変換したい時、以前は、spreadやgatherという関数がありました。(今もあるのですが、)上記2つに代わって新たに上位互換の関数として登場したのがpivot_longer、pivot_widerです。単純に縦持ち、横持ち変換するだけでなく、…

”pd.mearge”はもう遅い、Python"join"で高速データ結合

Pythonである値をkeyにデータを結合をしたいとき、pandasのmergeが使えますが、データの行数が膨大だと実行に時間がかかります。 www.medi-08-data-06.work そんなときには、joinを使うことで、データ結合の処理速度を上げることができます。 joinを使って …

kaggle-apiの使い方〜コンペのデータセットダウンロードから提出まで〜

通常kaggleコンペでは、データセットのダウンロードから、結果の提出までを、kaggleサイト上で行います。しかし、kaggle-apiを使うことで、データセットのダウンロード、コンペ一覧表示、submission、leaderboardの確認など、ほとんど全ての作業をコマンドラ…