从均值与中位数开始认识数据
拿到一组数据,先了解变量含义、样本数量、缺失情况和计量单位,再计算汇总指标。均值利用了每个观测值的信息,但容易受到极端数值的影响;中位数表示排序后的中间位置,能帮助我们观察偏态数据的典型水平。
分析时应结合数据的分布形状。直方图帮助观察集中区域和尾部,箱线图便于比较不同组的分布。一个平均数并不能完整描述数据。
记录概念,整理方法,在练习与复盘中加深理解。这里汇集概率统计、数据分析和学习方法的基础笔记。
拿到一组数据,先了解变量含义、样本数量、缺失情况和计量单位,再计算汇总指标。均值利用了每个观测值的信息,但容易受到极端数值的影响;中位数表示排序后的中间位置,能帮助我们观察偏态数据的典型水平。
分析时应结合数据的分布形状。直方图帮助观察集中区域和尾部,箱线图便于比较不同组的分布。一个平均数并不能完整描述数据。
期望描述随机变量在概率权重下的平均水平。对于离散随机变量,可将每个可能取值与其概率相乘,再将结果相加。方差衡量取值围绕期望的离散程度,标准差则与原变量保持相同单位。
期望不是对单次结果的承诺。只有理解可能取值及其概率,才能合理解释平均水平;比较方差时,也需要关注变量的单位与尺度。
样本统计量会随着抽样变化。用样本均值估计总体均值时,应同时关注抽样方式、样本量以及估计的精度。扩大样本量通常可以减小随机误差,却不能自动消除样本选择造成的系统偏差。
置信区间的置信水平描述方法在重复抽样中的长期覆盖比例。解释单次结果时,应避免将它简单理解为某个固定参数在已算出的区间内具有相同数值的概率。
回归模型用于刻画变量之间的关系。建模前需要明确研究问题、变量定义及数据采集方式;建模后可以检查残差、异常观测和预测误差,判断模型是否适合当前数据。
相关关系不能直接证明因果关系。遗漏变量、样本选择和反向因果都可能影响解释。如果目标是预测,还应使用独立的验证数据评估效果,避免只依据训练数据上的拟合程度作判断。
完成例题后,可以按“问题—条件—方法—结果—解释”五个部分整理。除了计算过程,还要写清使用方法的前提,以及结果如何回答最初的问题。
遇到错误时,区分概念理解、条件检查、计算步骤和结果解释中的问题。复习时尝试用自己的语言讲清原理,再换一组数据完成类似练习,检查是否真正理解。
以上内容为基础学习笔记。具体定义、推导和适用条件请结合教材及原始资料核对。