应用统计学

考试时间

6月17日 星期二 8:30——10:10

题型分布

选择 10题 2分一道 20分

填空 5题 2分一道 10分

判断 10题 1分一道 10分

简答 4题 5分一道 20分

计算 5题 8分一道 40分

image-4b4cb189

选填判

选填(10选15 5题没给)

  1. 某公司2021年至2023年的销售额(万元)分别为120、150、160,使用3年移动平均法预测2024年的销售额为?

    (120+150+160)/3=143.33

  2. 某公司员工年龄数据范围为22岁到50岁,需要分为5组来制作频数分布表。则最合理的组距为?

    (50-22)/5=5.6

    因为年龄一般是整数,所以最合理的组距是6

  3. 若检验两个总体比例是否相等时,样本1的观测成功数为x1=30(样本量n1=100),样本2的观测成功数为x2=45(样本量n2=150),则合并比例P为?

    公式:(p1+p2)/2

           p1=30/100  p2=45/150
    
          (3/10+3/10)/2=3/10
    
  4. 一批产品有10件,其中有2件次品,从中任取3件,则恰有1件次品的概率是?

    image-ba3faf3c
  5. 均匀分布的期望和方差

    image-29b7dba6

    均匀分布的期望:\(E(X)=(a+b)/2\)

    均匀分布的方差:\(D(X)=(b-a)^2/12\) (记两个公式就好,代值进去算)

  6. 某工厂生产两种型号的产品(型号A和型号B),分别从两种型号的广中随机抽取了10件样本。型号A:平均质量为100克,标准差为2克。型号B平均质量为102克,标准差为3克。假设两种型号产品的质量指标均服从正态分布,且方差相等,那么自由度为?

    公式:n1+n2-2(n代码每个型号取的样本数)

          10+10-2=18
    
  7. 向上累积法

    image-6133a6fd image-e5570763
  8. 在成对样本均值检验中,t检验统计量为?

    t=(X-E(X))/根号(D(X))

  9. 某公司的月收入可以分为5组:3000以下、3000-5000、5000-7000和7000以上,则最后一组的组中值为?

    因为3000-5000的组中值为4000,5000-7000的组中值是6000

    所以组中值之间的组距是6000-4000=2000

    即最后一组的组中值是6000+2000=8000

  10. 设有甲、乙二袋,甲袋中装有5只白球6只红球,乙袋中装有9只白球8只红球,今从甲袋中任取一球放入乙袋中,再从乙袋中任取一球,问:

    (1)从乙袋中取到白球的概率是多少?

    (2)如果现在从乙袋中取到的是白球,求从甲袋中也取到白球的概率。

    image-9e020bae

判断:(10选10?可能有陷阱)

  1. 统计学研究的对象是客观现象的数量特征和规律性。 ( √ )

  2. 实际应用中分组的数量和组距应根据对象的特点和分析的需要决定。 ( √ )

  3. 重叠组限指相邻组的上下限重合。 ( √ )

  4. 分层抽样又称为分类抽样或类型抽样。 ( √ )

  5. 有效性是对估计量的最基本要求。 ( × )

    无偏性是对估计量的最基本要求,有效性是在满足无偏性的前提下进一步追求的优良性质。

  6. 若想检验两个总体比例之比是否有差异,则计算Z统计进行决策。 ( √ )

    比例之间有差异 —— 用 Z 检验

      T 检验是用来“比较平均数”的,特别是在不知道总体标准差、而且样本又不大的时候。
    
  7. 若两个总体均值差的检验统计量大于分布函数的临界值,则拒绝原假设。 ( × )

  8. 卡方检验可以用于比较两组连续变量(如身高、体重)的平均值差异。 ( × )

      卡方检验主要用于:分类变量(类别变量)之间的关联性检验,比如性别与是否吸烟的关系、频数数据的独立性检验或适合度检验。
    
      不能用于比较连续变量(如身高、体重)的均值差异。
    
      比较连续变量均值差异应使用:t 检验(两个样本均值比较)、方差分析(ANOVA)(多组均值比较)等。
    
  9. 基于最小二乘法拟合趋势线时,目标是使预测值与实际值的离差平方和最小。 ( √ )

  10. 时间序列中的循环变动通常指周期小于一年的变动。 ( × )

    循环变动(cyclical variation)是指时间序列中周期性较长的波动,通常持续 几年到十几年不等,且周期通常 大于一年。

      例如经济周期、商业周期等都属于循环变动,周期往往是数年。
    
      季节变动(seasonal variation)指的是周期小于一年的规律性变动,通常是一年内的季节性波动(如季度、月份的变化)。
    

简答(8选4)

第一组(第一章):

请简述问卷设计一般要遵循哪些原则。P9

  1. **合理性:**问题设置应紧扣调查主题,围绕研究目标筛选相关内容,确保问卷的整体方向明确、有效。
  2. **一般性:**所设计的问题应具有普遍适用性,能够反映多数被调查者的情况,便于统计分析与归纳结论。
  3. **逻辑性:**问卷整体结构应条理清晰,前后问题安排要有逻辑顺序;各题目自身也要避免逻辑矛盾,确保问卷的系统性。
  4. **明确性:**语言表达要准确、清晰,避免模糊或歧义,使被调查者能理解题意并准确作答。
  5. **非诱导性:**问题措辞应保持中性,避免暗示或诱导被调查者作出特定答案,确保数据的客观性和可靠性。
  6. **便于整理与分析:**问卷设计应考虑数据后续的统计与处理,题型设置规范、选项设计合理,以提高数据分析的效率与有效性。

数据的计量尺度有几类?请分别写出来。 P12

  1. 定类尺度(名义尺度):只用于对事物进行分类,没有顺序或大小之分,不能进行加减运算。如性别、血型、民族、地区编码等。
  2. 定序尺度(顺序尺度):数据之间可以排序,但无法确定相邻等级之间的差距大小。如:满意度等级(如“满意”“一般”“不满意”)、比赛名次、服务评级等。
  3. 定距尺度(间隔尺度):数据不仅可以排序,还可以进行加减运算,但没有绝对零点,不能进行比例比较。如:温度(摄氏、华氏)、年份、智商(IQ)等。
  4. 定比尺度(比率尺度):具有定距尺度的全部特征,并且拥有绝对零点,可以进行各种数学运算。如:身高、体重、年龄、收入、数量等。

第二组(第十章)

请简述进行卡方检验的一般步骤。 P177

  1. 提出原假设:根据实际问题背景,提出总体 XX \(χ\) 服从某一分布\(F(x)\)的原假设 \(H_0\);
  2. **参数估计:**利用样本观察值\(x1,x2,…,xn\),对分布 \(F(x)\)中的 rrr 个未知参数进行点估计。
  3. 区间划分:将\(F(x)\)的定义域划分为k个互不相关的区间 \((a_i,a_{i+1}]\),其中 i=1,2,…,ki = 1, 2, \dots, k \(i=1,2,…,k\)。区间划分原则上应使每个区间的理论频数\(nP_i\)不小于 5,以保证检验的有效性。
  4. 计算频数与理论概率
    • 统计样本观察值落在每个区间\((a_i,a_{i+1})\)内的实际频数 fif_i \(f_i\),
    • 根据原假设和估计参数,计算出每个区间的理论频数\(nP_i\);
  5. 计算统计量\(χ 2\)的值,若\(χ^2 > χ_α^2(k-r-1)\),则拒绝原假设 \(H_0\),否则接受原假设\(H_0\)。

使用Kruskal-Wallis秩检验的假设。P193

(1)c组样本是从各自的总体随机、独立选出的。

(2)潜在的变量是连续的。

(3)可以给出数据在c组间的一系列秩。

(4)c总体有相同方差。

(5)c总体有相同形态。

第三组(第十一、十二章)

请简述一元回归的分析步骤。P209

  1. **建立模型:**根据问题的实际背景和有关专业理论知识,或对样本数据分析后,建立描述变量间相关关系的回归模型;
  2. **参数估计:**利用所得到的样本数据估计模型中的未知参数,得到回归方程;
  3. **显著性检验:**对所得回归方程和回归系数进行显著性检测;
  4. **预测与应用:**利用回归方程对被解释变量进行预测或控制。

请简述多元线性回归分析的有效性主要依赖于哪些基本假设。(书上没答案)

  1. 线性关系假设:因变量与各自变量之间存在线性关系。
  2. 误差项期望为零:假设误差项的数学期望为零,即 E(ε)=0E(\varepsilon) = 0 \(E(ε)=0\)。
  3. 误差项同方差性:所有观测值的误差项具有相同的方差,即\(D(εi)=σ2\),不存在异方差。
  4. 误差项之间互不相关:各误差项之间相互独立,不能存在自相关。
  5. 误差项服从正态分布:误差项应服从正态分布,特别是在进行显著性检验时要求成立。
  6. 无完全多重共线性:自变量之间不能存在线性完全相关,即不能存在完全多重共线性。

第四组(拓展)

请简述统计分析报告的结构。 (来自ppt)

统计分析报告通常包括以下五个部分:

  1. 标题

    位于报告最前部,是文章的名称,也是文章主题思想的体现。一个好的标题能准确反映研究内容,吸引读者关注,常被称为文章的“眼睛”。

  2. 摘要

    简明扼要地概括整个报告的核心内容,通常包括:

    • 研究背景和研究问题
    • 研究方法
    • 研究结果
    • 结论与建议
  3. 正文

    是报告的核心部分,一般包括以下几方面:

    • 绪论:介绍研究背景、目的和意义
    • 调查方案及实施:说明数据来源、抽样设计、问卷内容等
    • 数据分析:进行统计描述、推断分析、模型构建等
    • 结论与建议:归纳主要发现,提出改进建议或对策
  4. 参考文献

    列出报告中引用的书籍、期刊、数据库或其他资料,便于查阅与验证。

  5. 附录

    附加的辅助性资料,如原始数据表、问卷样本、技术细节说明、计算公式等。

请简述统计分析报告的作用。 (来自ppt)

统计分析报告是运用统计资料和统计分析方法,对所研究事物的本质和规律性进行表达的一种应用性文章,其主要作用包括:

  1. 集中展现分析成果:是统计分析过程中形成的论点、论据和结论的集中表现形式。
  2. 揭示客观规律:通过数字与文字相结合,揭示研究对象的数量特征和内在规律。
  3. 辅助科学决策:为管理层或相关部门提供科学依据,支持政策制定和实际决策。

计算(题型确定 得学)

第四章一道、第六章一道(ppt第十页例题)、第七章一道(ppt第17页例题)、第九章一道、第十一章一道

第一题 期望方差 (第四章)

设X~N(25,16),试描述4X+5的抽样分布。(提示:计算期望和方差)

c0bfbba26f1d5c0a1f0423fea812f6d-e81e06f8

第二题 置信区间(第六章)

  1. 某工厂生产的零件长度标准为10cm,现随机抽取25个零件测得平均长度为10.2cm,标准差为0.5cm。试在置信度95%下,估计零件长度的置信区间。(双侧估计,t0.025(24)=2.06)

    image-cc38f274
  2. 某公司生产的一种电子元件的使用寿命服从正态分布。为了估计这种电子元件的平均使用寿命,从中随机抽取了25个样品进行测试,得到样本均值为2000小时。假设总体标准差已知为120小时,请计算在95%置信水平下,这种电子元件平均使用寿命的置信区间。(Z0.025=1.96,Z0.05=1.645)

    image-f2dbe038
  3. image-de7a3ee0

第三题 单个假设检验(第七章)

  1. 某电子元件批量生产的质量标准为平均使用寿命1200小时,总体标准300小时。某厂宣称他们采用一种新工艺生产的元件质量大大超过规定标准。为了进行验证,随机抽取了100件作为样本,测得平均使用寿命1245小时。在a=0.05下,能否说该厂生产的电子元件质量显著高于规定标准及在a=0.01下的结果如何。

    需记忆:Za=Z0.05=1.645

    image-cd334878
  2. 某品牌电池声称其平均使用寿命为12小时,随机抽取了16块电池,得到样本均值为11.5小时,样本标准差为1.2小时。假设电池使用寿命服从正态分布,且总体方差未知。在显著性水平0.05下,检验该品牌电池的平均使用寿命是否为12小时。(t0.025(15)=2.131)

    image-5d416c78
  3. image-2de59fc6

第四题 方差分析 (第九章)

image-f147cfc9
  1. 某科研机构为了研究肥料对作物产量的影响,随机选取了120块试验田,并将它们平均分为四组,每组使用一种肥料,对这120块试验田的作物产量进行了方差分析,得到下表。请补齐下表中的A、B、C、D、E、H值,计算结果保留2位小数。

    image-d63b811b image-e801f84c
  2. image-b977d5ce

第五题 简单线性回归 (第十一章)

  1. 在其他条件不变的情况下,某种饮料的销量(y)与该饮料的价格(x有关。现对给定时期内的价格与销量进行观察,得到如下表所示的一组数据。试求销量对价格的回归直线,并预测该饮料价格为8元时的销量(注: \(∑x^2\)=720,\(∑xy\)=420)

    image-46e198be image-28150115
  2. image-bad73b0b