总体由研究问题划定
如果问题是“本校本学期所有在校生每天通勤多久”,总体就是这个范围内的学生。换成某年级、某城市或下一学期,总体边界就变了,不能沿用原来的结论而不说明。
样本是实际测量的对象,例如从名册中抽到并完成调查的200人。调查通常希望通过这些受访者的记录,推测全体学生的情况;能推得多可靠,要看抽到了谁、漏掉了谁。
一次调查有四层对象
- 01目标总体
你想了解谁
- 02抽样与接触
名单覆盖谁、抽到谁
- 03实际回答
最终观察到了谁
每一层都可能影响结论的适用范围。
样本大小与代表性是两件事
只在骑行社群收集一万份通勤问卷,可能遗漏不骑车的学生。数量很多并不消除这种覆盖差异;若研究对象是全体学生,样本如何进入调查比单纯的份数更关键。
即便采用合理随机抽样,不同次样本仍会得到略有不同的平均值。这种抽样波动不是有人必然做错,而是只观察部分对象时自然存在的不确定性。
说明结论能够推广的范围
一个班的普查可以覆盖该班总体,却未必代表全校;今天所有到场者的调查,也不等于所有报名者的调查。所谓“全量数据”总是相对于一个清楚定义的边界。
阅读报告时,可以依次问:想研究谁,名单覆盖谁,实际抽到谁,最后谁回答了。把这几层分开,才能判断差异来自随机波动还是系统遗漏,并说明结论适合用到哪里。