应用统计学
考试时间
6月17日 星期二 8:30——10:10
题型分布
选择 10题 2分一道 20分
填空 5题 2分一道 10分
判断 10题 1分一道 10分
简答 4题 5分一道 20分
计算 5题 8分一道 40分
选填判
选填(10选15 5题没给)
-
某公司2021年至2023年的销售额(万元)分别为120、150、160,使用3年移动平均法预测2024年的销售额为?
(120+150+160)/3=143.33
-
某公司员工年龄数据范围为22岁到50岁,需要分为5组来制作频数分布表。则最合理的组距为?
(50-22)/5=5.6
因为年龄一般是整数,所以最合理的组距是6
-
若检验两个总体比例是否相等时,样本1的观测成功数为x1=30(样本量n1=100),样本2的观测成功数为x2=45(样本量n2=150),则合并比例P为?
公式:(p1+p2)/2
p1=30/100 p2=45/150 (3/10+3/10)/2=3/10 -
一批产品有10件,其中有2件次品,从中任取3件,则恰有1件次品的概率是?
-
均匀分布的期望和方差
均匀分布的期望:\(E(X)=(a+b)/2\)
均匀分布的方差:\(D(X)=(b-a)^2/12\) (记两个公式就好,代值进去算)
-
某工厂生产两种型号的产品(型号A和型号B),分别从两种型号的广中随机抽取了10件样本。型号A:平均质量为100克,标准差为2克。型号B平均质量为102克,标准差为3克。假设两种型号产品的质量指标均服从正态分布,且方差相等,那么自由度为?
公式:n1+n2-2(n代码每个型号取的样本数)
10+10-2=18 -
向上累积法
-
在成对样本均值检验中,t检验统计量为?
t=(X-E(X))/根号(D(X))
-
某公司的月收入可以分为5组:3000以下、3000-5000、5000-7000和7000以上,则最后一组的组中值为?
因为3000-5000的组中值为4000,5000-7000的组中值是6000
所以组中值之间的组距是6000-4000=2000
即最后一组的组中值是6000+2000=8000
-
设有甲、乙二袋,甲袋中装有5只白球6只红球,乙袋中装有9只白球8只红球,今从甲袋中任取一球放入乙袋中,再从乙袋中任取一球,问:
(1)从乙袋中取到白球的概率是多少?
(2)如果现在从乙袋中取到的是白球,求从甲袋中也取到白球的概率。
判断:(10选10?可能有陷阱)
-
统计学研究的对象是客观现象的数量特征和规律性。 ( √ )
-
实际应用中分组的数量和组距应根据对象的特点和分析的需要决定。 ( √ )
-
重叠组限指相邻组的上下限重合。 ( √ )
-
分层抽样又称为分类抽样或类型抽样。 ( √ )
-
有效性是对估计量的最基本要求。 ( × )
无偏性是对估计量的最基本要求,有效性是在满足无偏性的前提下进一步追求的优良性质。
-
若想检验两个总体比例之比是否有差异,则计算Z统计进行决策。 ( √ )
比例之间有差异 —— 用 Z 检验
T 检验是用来“比较平均数”的,特别是在不知道总体标准差、而且样本又不大的时候。 -
若两个总体均值差的检验统计量大于分布函数的临界值,则拒绝原假设。 ( × )
-
卡方检验可以用于比较两组连续变量(如身高、体重)的平均值差异。 ( × )
卡方检验主要用于:分类变量(类别变量)之间的关联性检验,比如性别与是否吸烟的关系、频数数据的独立性检验或适合度检验。 不能用于比较连续变量(如身高、体重)的均值差异。 比较连续变量均值差异应使用:t 检验(两个样本均值比较)、方差分析(ANOVA)(多组均值比较)等。 -
基于最小二乘法拟合趋势线时,目标是使预测值与实际值的离差平方和最小。 ( √ )
-
时间序列中的循环变动通常指周期小于一年的变动。 ( × )
循环变动(cyclical variation)是指时间序列中周期性较长的波动,通常持续 几年到十几年不等,且周期通常 大于一年。
例如经济周期、商业周期等都属于循环变动,周期往往是数年。 季节变动(seasonal variation)指的是周期小于一年的规律性变动,通常是一年内的季节性波动(如季度、月份的变化)。
简答(8选4)
第一组(第一章):
请简述问卷设计一般要遵循哪些原则。P9
- **合理性:**问题设置应紧扣调查主题,围绕研究目标筛选相关内容,确保问卷的整体方向明确、有效。
- **一般性:**所设计的问题应具有普遍适用性,能够反映多数被调查者的情况,便于统计分析与归纳结论。
- **逻辑性:**问卷整体结构应条理清晰,前后问题安排要有逻辑顺序;各题目自身也要避免逻辑矛盾,确保问卷的系统性。
- **明确性:**语言表达要准确、清晰,避免模糊或歧义,使被调查者能理解题意并准确作答。
- **非诱导性:**问题措辞应保持中性,避免暗示或诱导被调查者作出特定答案,确保数据的客观性和可靠性。
- **便于整理与分析:**问卷设计应考虑数据后续的统计与处理,题型设置规范、选项设计合理,以提高数据分析的效率与有效性。
数据的计量尺度有几类?请分别写出来。 P12
- 定类尺度(名义尺度):只用于对事物进行分类,没有顺序或大小之分,不能进行加减运算。如性别、血型、民族、地区编码等。
- 定序尺度(顺序尺度):数据之间可以排序,但无法确定相邻等级之间的差距大小。如:满意度等级(如“满意”“一般”“不满意”)、比赛名次、服务评级等。
- 定距尺度(间隔尺度):数据不仅可以排序,还可以进行加减运算,但没有绝对零点,不能进行比例比较。如:温度(摄氏、华氏)、年份、智商(IQ)等。
- 定比尺度(比率尺度):具有定距尺度的全部特征,并且拥有绝对零点,可以进行各种数学运算。如:身高、体重、年龄、收入、数量等。
第二组(第十章)
请简述进行卡方检验的一般步骤。 P177
- 提出原假设:根据实际问题背景,提出总体 XX \(χ\) 服从某一分布\(F(x)\)的原假设 \(H_0\);
- **参数估计:**利用样本观察值\(x1,x2,…,xn\),对分布 \(F(x)\)中的 rrr 个未知参数进行点估计。
- 区间划分:将\(F(x)\)的定义域划分为k个互不相关的区间 \((a_i,a_{i+1}]\),其中 i=1,2,…,ki = 1, 2, \dots, k \(i=1,2,…,k\)。区间划分原则上应使每个区间的理论频数\(nP_i\)不小于 5,以保证检验的有效性。
- 计算频数与理论概率:
- 统计样本观察值落在每个区间\((a_i,a_{i+1})\)内的实际频数 fif_i \(f_i\),
- 根据原假设和估计参数,计算出每个区间的理论频数\(nP_i\);
- 计算统计量\(χ 2\)的值,若\(χ^2 > χ_α^2(k-r-1)\),则拒绝原假设 \(H_0\),否则接受原假设\(H_0\)。
使用Kruskal-Wallis秩检验的假设。P193
(1)c组样本是从各自的总体随机、独立选出的。
(2)潜在的变量是连续的。
(3)可以给出数据在c组间的一系列秩。
(4)c总体有相同方差。
(5)c总体有相同形态。
第三组(第十一、十二章)
请简述一元回归的分析步骤。P209
- **建立模型:**根据问题的实际背景和有关专业理论知识,或对样本数据分析后,建立描述变量间相关关系的回归模型;
- **参数估计:**利用所得到的样本数据估计模型中的未知参数,得到回归方程;
- **显著性检验:**对所得回归方程和回归系数进行显著性检测;
- **预测与应用:**利用回归方程对被解释变量进行预测或控制。
请简述多元线性回归分析的有效性主要依赖于哪些基本假设。(书上没答案)
- 线性关系假设:因变量与各自变量之间存在线性关系。
- 误差项期望为零:假设误差项的数学期望为零,即 E(ε)=0E(\varepsilon) = 0 \(E(ε)=0\)。
- 误差项同方差性:所有观测值的误差项具有相同的方差,即\(D(εi)=σ2\),不存在异方差。
- 误差项之间互不相关:各误差项之间相互独立,不能存在自相关。
- 误差项服从正态分布:误差项应服从正态分布,特别是在进行显著性检验时要求成立。
- 无完全多重共线性:自变量之间不能存在线性完全相关,即不能存在完全多重共线性。
第四组(拓展)
请简述统计分析报告的结构。 (来自ppt)
统计分析报告通常包括以下五个部分:
-
标题:
位于报告最前部,是文章的名称,也是文章主题思想的体现。一个好的标题能准确反映研究内容,吸引读者关注,常被称为文章的“眼睛”。
-
摘要:
简明扼要地概括整个报告的核心内容,通常包括:
- 研究背景和研究问题
- 研究方法
- 研究结果
- 结论与建议
-
正文:
是报告的核心部分,一般包括以下几方面:
- 绪论:介绍研究背景、目的和意义
- 调查方案及实施:说明数据来源、抽样设计、问卷内容等
- 数据分析:进行统计描述、推断分析、模型构建等
- 结论与建议:归纳主要发现,提出改进建议或对策
-
参考文献:
列出报告中引用的书籍、期刊、数据库或其他资料,便于查阅与验证。
-
附录:
附加的辅助性资料,如原始数据表、问卷样本、技术细节说明、计算公式等。
请简述统计分析报告的作用。 (来自ppt)
统计分析报告是运用统计资料和统计分析方法,对所研究事物的本质和规律性进行表达的一种应用性文章,其主要作用包括:
- 集中展现分析成果:是统计分析过程中形成的论点、论据和结论的集中表现形式。
- 揭示客观规律:通过数字与文字相结合,揭示研究对象的数量特征和内在规律。
- 辅助科学决策:为管理层或相关部门提供科学依据,支持政策制定和实际决策。
计算(题型确定 得学)
第四章一道、第六章一道(ppt第十页例题)、第七章一道(ppt第17页例题)、第九章一道、第十一章一道
第一题 期望方差 (第四章)
设X~N(25,16),试描述4X+5的抽样分布。(提示:计算期望和方差)
第二题 置信区间(第六章)
-
某工厂生产的零件长度标准为10cm,现随机抽取25个零件测得平均长度为10.2cm,标准差为0.5cm。试在置信度95%下,估计零件长度的置信区间。(双侧估计,t0.025(24)=2.06)
-
某公司生产的一种电子元件的使用寿命服从正态分布。为了估计这种电子元件的平均使用寿命,从中随机抽取了25个样品进行测试,得到样本均值为2000小时。假设总体标准差已知为120小时,请计算在95%置信水平下,这种电子元件平均使用寿命的置信区间。(Z0.025=1.96,Z0.05=1.645)
-
第三题 单个假设检验(第七章)
-
某电子元件批量生产的质量标准为平均使用寿命1200小时,总体标准300小时。某厂宣称他们采用一种新工艺生产的元件质量大大超过规定标准。为了进行验证,随机抽取了100件作为样本,测得平均使用寿命1245小时。在a=0.05下,能否说该厂生产的电子元件质量显著高于规定标准及在a=0.01下的结果如何。
需记忆:Za=Z0.05=1.645
-
某品牌电池声称其平均使用寿命为12小时,随机抽取了16块电池,得到样本均值为11.5小时,样本标准差为1.2小时。假设电池使用寿命服从正态分布,且总体方差未知。在显著性水平0.05下,检验该品牌电池的平均使用寿命是否为12小时。(t0.025(15)=2.131)
-
第四题 方差分析 (第九章)
-
某科研机构为了研究肥料对作物产量的影响,随机选取了120块试验田,并将它们平均分为四组,每组使用一种肥料,对这120块试验田的作物产量进行了方差分析,得到下表。请补齐下表中的A、B、C、D、E、H值,计算结果保留2位小数。
-
第五题 简单线性回归 (第十一章)
-
在其他条件不变的情况下,某种饮料的销量(y)与该饮料的价格(x有关。现对给定时期内的价格与销量进行观察,得到如下表所示的一组数据。试求销量对价格的回归直线,并预测该饮料价格为8元时的销量(注: \(∑x^2\)=720,\(∑xy\)=420)
-
💬 评论