
外れ値を素早く確認したい場面では、箱ひげ図が有効です。データを小さい順に並べ、Q1、中央値、Q3を取れば、IQR = Q3 − Q1でばらつきの中心をつかめます。そこから下限 Q1−1.5×IQR、上限 Q3+1.5×IQR を置くと、視覚的にも判定しやすくなります。
医療現場では、血圧、BMI、検査値など「値の散らばり」を一目で見たいときに向いています。単純な平均値だけで見ると、1件の極端値に引っ張られて全体像を誤読しやすいため、箱ひげ図での確認は実務上の基本です。
参考として、箱ひげ図による外れ値判定は統計教育サイトでも広く紹介されており、IQRベースの閾値が実務で使いやすいことが示されています。
外れ値の見つけ方
データが正規分布に近いと考えられるなら、平均値と標準偏差を使う方法が分かりやすいです。代表的には「平均±2σ」や「平均±3σ」を目安にし、その外側の値を外れ値候補とみなします。特に品質管理や検査値の簡易チェックでは、直感的で説明しやすい利点があります。
ただし、標準偏差は外れ値の影響を受けやすいので、最初から極端値が混じるデータでは基準がずれることがあります。つまり、「外れ値を見つけるために標準偏差を使う」のは便利ですが、万能ではありません。分布が歪んでいるときは、IQRのほうが安定しやすいです。
医療統計の解説でも、外れ値を含むと平均が引っ張られるため、中央値を使う選択肢があるとされています。
外れ値と記述統計
スミルノフ・グラブス検定は、正規分布を仮定したうえで、平均値から最も離れた1点が外れ値かどうかを検定する方法です。検定統計量は、平均との差を標準偏差で割る形で表され、臨界値と比較して判定します。1点ずつ外れ値を確認したいときに向いています。
この方法の強みは、「なんとなく外れて見える」ではなく、統計的な根拠をもって判定できることです。一方で、正規性が崩れているデータや、外れ値が複数あるデータでは扱いが難しくなります。外れ値を1個除いたあとに再検定する逐次的な運用もありますが、除外の理由を記録しておくことが大切です。
医療統計の資料でも、正規分布が前提にある場合にグラブス検定を使う考え方が示されています。
外れ値の判定方法
医療データでは、外れ値を見つけたらすぐ消すのではなく、まず原因を確認します。採血エラー、入力ミス、単位の取り違え、記録漏れのような理由があるなら、統計処理より先にデータ整備の問題として扱うべきです。逆に、臨床的に意味のある極端値なら、除外せずに残す判断も必要です。
ここで重要なのは、外れ値は「悪い値」ではないことです。たとえば急変例や重症例では、むしろ臨床的な信号である可能性があります。平均から遠いというだけで除外すると、現場の重要な変化を見落とす危険があります。
医療統計では、外れ値を除いた解析と除かない解析を併記して差を確認する考え方もあります。
外れ値の統計学的扱い
見落とされやすいのは、外れ値の「1点」よりも「外れ方のパターン」です。単発の極端値だけでなく、特定の曜日、装置、病棟、担当者に偏って外れ値が出るなら、個別の異常値ではなく系統誤差や運用上の癖を疑うべきです。つまり、外れ値は点ではなく、工程のサインとして読む発想が役立ちます。
この視点を入れると、単純に除外するだけではなく、再発防止までつながります。医療データは人手、装置、記録の影響を受けやすいため、「なぜこの値だけ飛んだのか」を工程単位で追うことが、分析精度を上げる近道です。
参考リンクは、IQRと箱ひげ図の基本を押さえたうえで、現場の判断材料として使える内容です。
厚生労働省
【第2類医薬品】by Amazon ユーシップFRテープVα 50枚