总体由研究问题划定

如果问题是“本校本学期所有在校生每天通勤多久”,总体就是这个范围内的学生。换成某年级、某城市或下一学期,总体边界就变了,不能沿用原来的结论而不说明。

样本是实际测量的对象,例如从名册中抽到并完成调查的200人。调查通常希望通过这些受访者的记录,推测全体学生的情况;能推得多可靠,要看抽到了谁、漏掉了谁。

一眼看懂 / 示意图

一次调查有四层对象

  1. 01目标总体

    你想了解谁

  2. 02抽样与接触

    名单覆盖谁、抽到谁

  3. 03实际回答

    最终观察到了谁

每一层都可能影响结论的适用范围。

样本大小与代表性是两件事

只在骑行社群收集一万份通勤问卷,可能遗漏不骑车的学生。数量很多并不消除这种覆盖差异;若研究对象是全体学生,样本如何进入调查比单纯的份数更关键。

即便采用合理随机抽样,不同次样本仍会得到略有不同的平均值。这种抽样波动不是有人必然做错,而是只观察部分对象时自然存在的不确定性。

说明结论能够推广的范围

一个班的普查可以覆盖该班总体,却未必代表全校;今天所有到场者的调查,也不等于所有报名者的调查。所谓“全量数据”总是相对于一个清楚定义的边界。

阅读报告时,可以依次问:想研究谁,名单覆盖谁,实际抽到谁,最后谁回答了。把这几层分开,才能判断差异来自随机波动还是系统遗漏,并说明结论适合用到哪里。