1 / 61
文档名称:

第五讲——主成分分析和因子分析.ppt

格式:ppt   大小:536KB   页数:61页
下载后只包含 1 个 PPT 格式的文档,没有任何的图纸或源代码,查看文件列表

如果您已付费下载过本站文档,您可以点这里二次下载

分享

预览

第五讲——主成分分析和因子分析.ppt

上传人:mh900965 2018/3/21 文件大小:536 KB

下载得到文件列表

第五讲——主成分分析和因子分析.ppt

相关文档

文档介绍

文档介绍:模型选择是艺术,而不是科学。
——William Navidi
主成分分析和因子分析
2008年8月
在研究实际问题时,往往需要收集多个变量。但这样会使多个变量间存在较强的相关关系,即这些变量间存在较多的信息重复,直接利用它们进行分析,不但模型复杂,还会因为变量间存在多重共线性而引起较大的误差
为能够充分利用数据,通常希望用较少的新变量代替原来较多的旧变量,同时要求这些新变量尽可能反映原变量的信息
主成分分析和因子分子正是解决这类问题的有效方法。它们能够提取信息,使变量简化降维,从而使问题更加简单直观
2008年8月
因子分析得到的是什么?
因子分析方法在部分领域应用的一些例子
心理学:心理学家瑟斯登对56项测验的得分进行因子分析,得出了7中主要智利因子:词语理解能力,语言流畅能力、计数能力、空间能力、记忆力、知觉速度和推理能力
教育学:某师范大学在对以幼儿园3~6岁幼儿为对象,通过80名幼儿教师对480名幼儿好奇心行为特征描述的开放式问卷调查,编制出60个项目的初始问卷,对500名幼儿的初测结果进行探索性因子分析后,形成了33个项目的正式问卷,对1000名幼儿的评价结果进行验证性因子分析,结果表明:教师评价的3~6岁幼儿好奇心结构包括敏感、对未知事物的关注、好问、喜欢摆弄、探索持久和好奇体验6个因子
2008年8月
因子分析得到的是什么?
医学:一位研究者对山东某县2000~2002年3年的全死因调查资料中不同地区各恶性肿瘤标化死亡率进行因子分析后发现,该县居民恶性肿瘤的发病和死亡具有明显的地区分布。在地区分布中,各种恶性肿瘤的死亡具有一定程度的聚集性。%;10种恶性肿瘤中,被解释的比例最小也在62%以上;而胃癌、白血病、膀胱癌、乳腺癌、结肠癌死亡率被解释的比例均在77%以上,表明这10种恶性肿瘤之间存在中等偏强的内在联系和地区分布特点
2008年8月
因子分析得到的是什么?
地质学:海南岛的石绿铁矿及外围地区有透辉石透闪岩石和阳起石两种岩石。地质工作者对两种岩石标本的11种化验数据进行了因子分析,分别得到5种和4种主要因子。结果表明,透辉石透闪岩石与阳起石有明显区别,前者的元素组合属碳酸盐沉积型,后者属岩浆分异型。透辉石透闪岩石中铁的沉积与泥质成分有关,属于正常沉积。由此推断石绿铁矿的主要成矿为沉积作用,并据此提出了找矿标志和找矿方向
上市公司评价:某研究者选择35家能源类上市公司,根据2007年的12项经营指标数据,采用因子分析法分别按盈利能力、资产管理能力、偿债能力及经营业绩综合评分等方面对35家上市公司进行了排名。其中:盈利能力排在前5位的是:神火股份、海油工程、兰花科创、潞安环能和中国石油;经营业绩综合得分排在前5位的是:神火股份、潞安环能、兰花科创、海油工程和开滦股份
2008年8月
主成分分析的基本原理
1. 主成分分析
2008年8月
主成分的概念由Karl Pearson在1901年提出
考察多个变量间相关性一种多元统计方法
研究如何通过少数几个主成分(ponent)来解释多个变量间的内部结构。即从原始变量中导出少数几个主分量,使它们尽可能多地保留原始变量的信息,且彼此间互不相关
主成分分析的目的:数据的压缩;数据的解释
常被用来寻找判断事物或现象的综合指标,并对综合指标所包含的信息进行适当的解释
什么是主成分分析? (ponent analysis)
2008年8月
主成分分析的基本思想
主成分分析就是设法将原来的p个指标重新组合成一组相互无关的新指标的过程。通常数学上的处理就是将原来的p个指标做线性组合。
以两个指标为例,有两个指标来衡量n个样本点的二位空间。在该二位空间,n个样本点的变量信息若用利差平方和来表示,则变量的信息总量为总方差:
(1)如果离差平方和和之间相差悬殊,如取值之比为10:1,这说明变量x1在方差总信息量中占有较重要的地位,可剔除变量x2达到降维的目的。
2008年8月
主成分分析的基本思想
(2)如果和数值相差不大,则说明这两个指标在方差总信息量中的比重相当,在做统计分析是两个指标都不能放弃,此时可对x1、x2作适当的变量替换,通过某种方法寻找两个新的变量y1、y2(必须是原变量的线性组合),使新变量满足:
上式说明新变量y继承了原变量x的全部信息,并且要求
和数值比例相差较大,只是仅用y1进行分析可以了。此时的y1方差最大,包含的信息最多。Y1称为第一主成分,y2称为第二主成分。
Y1的方差越大,表示其包含的信息越多。如果第一主成分还不能反映原指标的全部信息,再考虑选取第二主成分,依此类推。
2008年8月
对这两个相关变量所携带的信息(在统