--- title: "01-应用统计学" created: 2025-12-02 tags: - 博客 --- # 应用统计学 ## 考试时间 6月17日 星期二 8:30——10:10 ## 题型分布 选择 10题 2分一道 20分 填空 5题 2分一道 10分 判断 10题 1分一道 10分 简答 4题 5分一道 20分 计算 5题 8分一道 40分 ![[image-4b4cb189.png]] ## 选填判 ### 选填(10选15 5题没给) 1. 某公司2021年至2023年的销售额(万元)分别为120、150、160,使用3年移动平均法预测2024年的销售额为? (120+150+160)/3=143.33 2. 某公司员工年龄数据范围为22岁到50岁,需要分为5组来制作频数分布表。则最合理的组距为? (50-22)/5=5.6 因为年龄一般是整数,所以最合理的组距是6 3. 若检验两个总体比例是否相等时,样本1的观测成功数为x1=30(样本量n1=100),样本2的观测成功数为x2=45(样本量n2=150),则合并比例P为? 公式:(p1+p2)/2 p1=30/100 p2=45/150 (3/10+3/10)/2=3/10 4. 一批产品有10件,其中有2件次品,从中任取3件,则恰有1件次品的概率是? ![[image-ba3faf3c.png]] 5. 均匀分布的期望和方差 ![[image-29b7dba6.png]] 均匀分布的期望:\(E(X)=(a+b)/2\) 均匀分布的方差:\(D(X)=(b-a)^2/12\) (记两个公式就好,代值进去算) 6. 某工厂生产两种型号的产品(型号A和型号B),分别从两种型号的广中随机抽取了10件样本。型号A:平均质量为100克,标准差为2克。型号B平均质量为102克,标准差为3克。假设两种型号产品的质量指标均服从正态分布,且方差相等,那么自由度为? 公式:n1+n2-2(n代码每个型号取的样本数) 10+10-2=18 7. 向上累积法 ![[image-6133a6fd.png]] ![[image-e5570763.png]] 8. 在成对样本均值检验中,t检验统计量为? t=(X-E(X))/根号(D(X)) 9. 某公司的月收入可以分为5组:3000以下、3000-5000、5000-7000和7000以上,则最后一组的组中值为? 因为3000-5000的组中值为4000,5000-7000的组中值是6000 所以组中值之间的组距是6000-4000=2000 即最后一组的组中值是6000+2000=8000 10. 设有甲、乙二袋,甲袋中装有5只白球6只红球,乙袋中装有9只白球8只红球,今从甲袋中任取一球放入乙袋中,再从乙袋中任取一球,问: (1)从乙袋中取到白球的概率是多少? (2)如果现在从乙袋中取到的是白球,求从甲袋中也取到白球的概率。 ![[image-9e020bae.png]] ### 判断:(10选10?可能有陷阱) 1. 统计学研究的对象是客观现象的数量特征和规律性。 ( √ ) 2. 实际应用中分组的数量和组距应根据对象的特点和分析的需要决定。 ( √ ) 3. 重叠组限指相邻组的上下限重合。 ( √ ) 4. 分层抽样又称为分类抽样或类型抽样。 ( √ ) 5. 有效性是对估计量的最基本要求。 ( × ) **无偏性是对估计量的最基本要求**,有效性是在满足无偏性的前提下进一步追求的优良性质。 6. 若想检验两个总体比例之比是否有差异,则计算Z统计进行决策。 ( √ ) 比例之间有差异 —— 用 Z 检验 T 检验是用来“比较平均数”的,特别是在不知道总体标准差、而且样本又不大的时候。 7. 若两个总体均值差的检验统计量大于分布函数的临界值,则拒绝原假设。 ( × ) 8. 卡方检验可以用于比较两组连续变量(如身高、体重)的平均值差异。 ( × ) 卡方检验主要用于:分类变量(类别变量)之间的关联性检验,比如性别与是否吸烟的关系、频数数据的独立性检验或适合度检验。 不能用于比较连续变量(如身高、体重)的均值差异。 比较连续变量均值差异应使用:t 检验(两个样本均值比较)、方差分析(ANOVA)(多组均值比较)等。 9. 基于最小二乘法拟合趋势线时,目标是使预测值与实际值的离差平方和最小。 ( √ ) 10. 时间序列中的循环变动通常指周期小于一年的变动。 ( × ) 循环变动(cyclical variation)是指时间序列中周期性较长的波动,通常持续 几年到十几年不等,且周期通常 大于一年。 例如经济周期、商业周期等都属于循环变动,周期往往是数年。 季节变动(seasonal variation)指的是周期小于一年的规律性变动,通常是一年内的季节性波动(如季度、月份的变化)。 ## 简答(8选4) ### 第一组(第一章): 请简述问卷设计一般要遵循哪些原则。P9 1. **合理性:**问题设置应紧扣调查主题,围绕研究目标筛选相关内容,确保问卷的整体方向明确、有效。 2. **一般性:**所设计的问题应具有普遍适用性,能够反映多数被调查者的情况,便于统计分析与归纳结论。 3. **逻辑性:**问卷整体结构应条理清晰,前后问题安排要有逻辑顺序;各题目自身也要避免逻辑矛盾,确保问卷的系统性。 4. **明确性:**语言表达要准确、清晰,避免模糊或歧义,使被调查者能理解题意并准确作答。 5. **非诱导性:**问题措辞应保持中性,避免暗示或诱导被调查者作出特定答案,确保数据的客观性和可靠性。 6. **便于整理与分析:**问卷设计应考虑数据后续的统计与处理,题型设置规范、选项设计合理,以提高数据分析的效率与有效性。 数据的计量尺度有几类?请分别写出来。 P12 1. **定类尺度(名义尺度)**:只用于对事物进行分类,没有顺序或大小之分,不能进行加减运算。如性别、血型、民族、地区编码等。 2. **定序尺度(顺序尺度)**:数据之间可以排序,但无法确定相邻等级之间的差距大小。如:满意度等级(如“满意”“一般”“不满意”)、比赛名次、服务评级等。 3. **定距尺度(间隔尺度)**:数据不仅可以排序,还可以进行加减运算,但没有绝对零点,不能进行比例比较。如:温度(摄氏、华氏)、年份、智商(IQ)等。 4. **定比尺度(比率尺度)**:具有定距尺度的全部特征,并且拥有绝对零点,可以进行各种数学运算。如:身高、体重、年龄、收入、数量等。 ### 第二组(第十章) 请简述进行卡方检验的一般步骤。 P177 1. **提出原假设:**根据实际问题背景,提出总体 XX \(χ\) 服从某一分布\(F(x)\)的**原假设** \(H\_0\); 2. **参数估计:**利用样本观察值\(x1,x2,…,xn\),对分布 \(F(x)\)中的 rrr 个未知参数进行点估计。 3. **区间划分**:将\(F(x)\)的定义域划分为k个互不相关的区间 \((a\_i,a\_{i+1}]\),其中 i=1,2,…,ki = 1, 2, \dots, k \(i=1,2,…,k\)。区间划分原则上应使每个区间的理论频数\(nP\_i\)不小于 5,以保证检验的有效性。 4. **计算频数与理论概率**: - 统计样本观察值落在每个区间\((a\_i,a\_{i+1})\)内的实际频数 fif\_i \(f\_i\), - 根据原假设和估计参数,计算出每个区间的理论频数\(nP\_i\); 5. 计算统计量\(χ 2\)的值,若\(χ^2 > χ\_α^2(k-r-1)\),则拒绝原假设 \(H\_0\),否则接受原假设\(H\_0\)。 使用Kruskal-Wallis秩检验的假设。P193 (1)c组样本是从各自的总体随机、独立选出的。 (2)潜在的变量是连续的。 (3)可以给出数据在c组间的一系列秩。 (4)c总体有相同方差。 (5)c总体有相同形态。 ### 第三组(第十一、十二章) 请简述一元回归的分析步骤。P209 1. **建立模型:**根据问题的实际背景和有关专业理论知识,或对样本数据分析后,建立描述变量间相关关系的回归模型; 2. **参数估计:**利用所得到的样本数据估计模型中的未知参数,得到回归方程; 3. **显著性检验:**对所得回归方程和回归系数进行显著性检测; 4. **预测与应用:**利用回归方程对被解释变量进行预测或控制。 请简述多元线性回归分析的有效性主要依赖于哪些基本假设。(书上没答案) 1. **线性关系假设**:因变量与各自变量之间存在线性关系。 2. **误差项期望为零**:假设误差项的数学期望为零,即 E(ε)=0E(\varepsilon) = 0 \(E(ε)=0\)。 3. **误差项同方差性**:所有观测值的误差项具有相同的方差,即\(D(εi)=σ2\),不存在异方差。 4. **误差项之间互不相关**:各误差项之间相互独立,不能存在自相关。 5. **误差项服从正态分布**:误差项应服从正态分布,特别是在进行显著性检验时要求成立。 6. **无完全多重共线性**:自变量之间不能存在线性完全相关,即不能存在完全多重共线性。 ### 第四组(拓展) 请简述统计分析报告的结构。 (来自ppt) 统计分析报告通常包括以下五个部分: 1. **标题**: 位于报告最前部,是文章的名称,也是文章主题思想的体现。一个好的标题能准确反映研究内容,吸引读者关注,常被称为文章的“眼睛”。 2. **摘要**: 简明扼要地概括整个报告的核心内容,通常包括: - 研究背景和研究问题 - 研究方法 - 研究结果 - 结论与建议 3. **正文**: 是报告的核心部分,一般包括以下几方面: - 绪论:介绍研究背景、目的和意义 - 调查方案及实施:说明数据来源、抽样设计、问卷内容等 - 数据分析:进行统计描述、推断分析、模型构建等 - 结论与建议:归纳主要发现,提出改进建议或对策 4. **参考文献**: 列出报告中引用的书籍、期刊、数据库或其他资料,便于查阅与验证。 5. **附录**: 附加的辅助性资料,如原始数据表、问卷样本、技术细节说明、计算公式等。 请简述统计分析报告的作用。 (来自ppt) 统计分析报告是运用统计资料和统计分析方法,对所研究事物的本质和规律性进行表达的一种应用性文章,其主要作用包括: 1. **集中展现分析成果**:是统计分析过程中形成的论点、论据和结论的集中表现形式。 2. **揭示客观规律**:通过数字与文字相结合,揭示研究对象的数量特征和内在规律。 3. **辅助科学决策**:为管理层或相关部门提供科学依据,支持政策制定和实际决策。 ## 计算(题型确定 得学) 第四章一道、第六章一道(ppt第十页例题)、第七章一道(ppt第17页例题)、第九章一道、第十一章一道 ### 第一题 期望方差 (第四章) 设X~N(25,16),试描述4X+5的抽样分布。(提示:计算期望和方差) ![[c0bfbba26f1d5c0a1f0423fea812f6d-e81e06f8.jpg]] ### 第二题 置信区间(第六章) 1. 某工厂生产的零件长度标准为10cm,现随机抽取25个零件测得平均长度为10.2cm,标准差为0.5cm。试在置信度95%下,估计零件长度的置信区间。(双侧估计,t0.025(24)=2.06) ![[image-cc38f274.png]] 2. 某公司生产的一种电子元件的使用寿命服从正态分布。为了估计这种电子元件的平均使用寿命,从中随机抽取了25个样品进行测试,得到样本均值为2000小时。假设总体标准差已知为120小时,请计算在95%置信水平下,这种电子元件平均使用寿命的置信区间。(Z0.025=1.96,Z0.05=1.645) ![[image-f2dbe038.png]] 3. ![[image-de7a3ee0.png]] ### 第三题 单个假设检验(第七章) 1. 某电子元件批量生产的质量标准为平均使用寿命1200小时,总体标准300小时。某厂宣称他们采用一种新工艺生产的元件质量大大超过规定标准。为了进行验证,随机抽取了100件作为样本,测得平均使用寿命1245小时。在a=0.05下,能否说该厂生产的电子元件质量显著高于规定标准及在a=0.01下的结果如何。 需记忆:Za=Z0.05=1.645 ![[image-cd334878.png]] 2. 某品牌电池声称其平均使用寿命为12小时,随机抽取了16块电池,得到样本均值为11.5小时,样本标准差为1.2小时。假设电池使用寿命服从正态分布,且总体方差未知。在显著性水平0.05下,检验该品牌电池的平均使用寿命是否为12小时。(t0.025(15)=2.131) ![[image-5d416c78.png]] 3. ![[image-2de59fc6.png]] ### 第四题 方差分析 (第九章) ![[image-f147cfc9.png]] 1. 某科研机构为了研究肥料对作物产量的影响,随机选取了120块试验田,并将它们平均分为四组,每组使用一种肥料,对这120块试验田的作物产量进行了方差分析,得到下表。请补齐下表中的A、B、C、D、E、H值,计算结果保留2位小数。 ![[image-d63b811b.png]] ![[image-e801f84c.png]] 2. ![[image-b977d5ce.png]] ### 第五题 简单线性回归 (第十一章) 1. 在其他条件不变的情况下,某种饮料的销量(y)与该饮料的价格(x有关。现对给定时期内的价格与销量进行观察,得到如下表所示的一组数据。试求销量对价格的回归直线,并预测该饮料价格为8元时的销量(注: \(∑x^2\)=720,\(∑xy\)=420) ![[image-46e198be.png]] ![[image-28150115.png]] 2. ![[image-bad73b0b.png]]