Correspondence Analysis 对应分析原理及R实现

2026年09月25日 22:51
有1个网友回答
网友(1):

对应分析(correspondence) 由J.P.Bepzecri 于1970年提出,是在因子分析基础上发展的多元统计方法,也称 R-Q 分析。通过分析属性(attribute-categorial)构成的列联表来揭示变量之间的关系,可以用列联表显示。对应分析利用降维的思想对行和列同时处理来达到简化数据结构的目的。最后列联表的行和列中各属性的比例结构会以点的形式在低维空间中表示出来。

e.g

SVD:

此处

中有2个非零奇异值,因此选取维数为2。

奇异值分解

在矩阵 M 的奇异值分解中

本例中:

维度1的惯量:

维度2的惯量:

总惯量:

由维度1解释的总差异百分比:(proportion of variance explained by dimension1)

由维度2解释的总差异百分比:(proportion of variance explained by dimension2)

对惯量的贡献:

即young(0.726)对维度1主要贡献,middle(0.418)与 old (0.581)对维度2有主要贡献。同时由于符号问题-0.646与0.6752,因此维度2还体现了middle组与old组之间的差异


本例中维度为2解释力为100

为了跟踪1980年至1983年银行和储蓄与贷款(SL)机构形象的变化,并在一个二维空间中表示它们,向750名随机受访者邮寄了问卷,1980年和1983年的回复率分别为43%和42%,受访者被要求决定在13种具体的金融服务中,选择两类机构中哪一种(或两种)更好。结果以百分比形式储存在列联表中。

即在1980年, 的受访者认为SL的Checking accounts服务更好, 的受访者认为二者服务的质量一样。

此为惯量值与对应的维数,其中value为对应奇异值的平方, 为从1到此维数的解释百分比

维数最大为7是因为

本例中选维数为2即能得到解释力大于 的结果,同时二维也方便可视化。

行衡量的是服务方面的信息,结果如下:

此结果为每个行指标的mass,qlt: quality表示给定的维度的对行指标解释力之和,其中对Convenient locations的解释度最低为 ,对Savings return 的解释度最高为 。

k=1与k=2代表维度1与维度2每行中对应的坐标,ctr代表每个行指标对维度的contribution

例如Mortgage Loans对维度1的贡献达到了 ,Savings return 达到了 ;Checking accounts 对维度2的贡献达到了

同时坐标的正负能够体现两行的差异,比如k=1中Savings return的坐标为1.091,而Checking accounts的坐标为-0.490。

本例中基于维度1与2可解释:

客户将从以下方面区分SL和银行的形象:

列衡量的是随时间对两种服务的感知状况,结果如下:

解释方法类似。

2.ca包的结果 可用fit$读取