版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
第7章SPSS的非參數檢驗單樣本的非參數檢驗兩獨立樣本的非參數檢驗多獨立樣本的非參數檢驗兩配對樣本的非參數檢驗多配對樣本的非參數檢驗單樣本的非參數檢驗單樣本非參數檢驗:對單個總體的分布類型等進行推斷,主要包括:卡方檢驗、二項分布檢驗、K-S檢驗、變量值隨機性檢驗總體分布的卡方檢驗基本思想:根據樣本數據,推斷總體分布與期望分布或某一理論分布是否存在顯著差異,是一種吻合性檢驗適用于對有多個分類值的總體分布的分析原假設H0:樣本來自的總體分布與期望分布或某一理論分布無顯著差異檢驗統計量:決策:若χ2的概率P-值小于顯著性水平α,則應拒絕原假設,認為樣本來自的總體分布與期望分布或某一理論分布存在顯著差異;反之單樣本的非參數檢驗示例與操作單樣本的非參數檢驗二項分布檢驗基本思想:通過樣本數據檢驗樣本來自的總體是否服從指定概率為p的二項分布原假設H0:樣本來自的總體與指定的二項分布無顯著差異檢驗統計量小樣本下的精確統計量:大樣本下的近似統計量:決策:若概率值小于顯著性水平α,則拒絕原假設,認為樣本來自的總體與指定的二項分布有顯著差異;反之單樣本的非參數檢驗示例與操作單樣本的非參數檢驗單樣本K-S檢驗基本思想:利用樣本數據推斷樣本來自的總體是否服從某一理論分布,是一種擬合優度的檢驗適用于探索連續型隨機變量的分布檢驗統計量決策:若樣本的總體分布與理論分布的差異不明顯,則D不應較大若D統計量的概率P-值小于顯著性水平α,則應拒絕原假設,認為樣本來自的總體與指定的分布有顯著差異;反之單樣本的非參數檢驗示例與操作單樣本的非參數檢驗變量值隨機性檢驗基本思想:通過對樣本觀測值的分析,實現對變量值的出現是不是隨機進行檢驗原假設H0:變量值的出現是隨機的檢驗統計量:基于游程構建游程是觀測值序列中連續出現相同數值的次數決策:如果概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為變量值的出現不是隨機的;反之。單樣本的非參數檢驗示例與操作兩獨立樣本的非參數檢驗兩獨立樣本的非參數檢驗:在對總體分布不甚了解的情況下,通過對兩個獨立樣本的分析推斷樣本來自的兩總體的分布是否存在顯著差異主要方法:曼惠特尼U檢驗K-S檢驗W-W游程檢驗極端反應檢驗示例兩獨立樣本的非參數檢驗兩獨立樣本的曼惠特尼U檢驗基本思想:通過對兩個樣本平均秩的研究來進行推斷秩,簡單說就是變量值排序的名次原假設H0:兩獨立樣本來自的兩總體的分布無顯著差異檢驗統計量:決策:如果概率P-值小于給定的顯著性水平α,則拒絕原假設,認為樣本來自的兩總體的分布存在顯著差異;反之。兩獨立樣本的非參數檢驗兩獨立樣本的K-S檢驗原假設H0:兩獨立樣本來自的兩總體的分布無顯著差異計算步驟:首先,將兩樣本混合并按升序排序然后,分別計算兩樣本秩的累計頻數和累計頻率最后,計算兩組累計頻率差的絕對值,得到累計頻率絕對差序列并得到D統計量決策:如果概率P-值小于給定的顯著性水平α,則拒絕原假設,認為樣本來自的兩總體的分布存在顯著差異;反之。兩獨立樣本的非參數檢驗兩獨立樣本的游程檢驗原假設H0:兩獨立樣本來自的兩總體的分布無顯著差異計算依據:游程,且游程數依賴于變量的秩計算步驟:首先,將兩樣本混合并按升序排序然后,對組標記值序列計算游程數如果兩總體的分布存在較大差距,那么基于組標記的游程數會相對比較少;反之最后,根據游程數計算Z統計量,該統計量近似服從正態分布決策:如果概率P-值小于給定的顯著性水平α,則拒絕原假設,認為樣本來自的兩總體的分布存在顯著差異;反之。兩獨立樣本的非參數檢驗兩獨立樣本的極端反映檢驗原假設H0:兩獨立樣本來自的兩總體的分布無顯著差異計算依據:將一個樣本作為控制樣本,另一個樣本作為實驗樣本計算步驟:首先,將兩個樣本混合按升序排序然后,求出控制樣本的最小秩Qmin和最大秩Qmax,并計算出跨度(Span):S=Qmax-Qmin+1最后,為消除樣本數據中極端值對分析結果的影響,在計算跨度之前可按比例(通常為5%)剔除控制樣本中2h個靠近兩端的觀測值,然后再求跨度,得到截頭跨度決策:如果概率P-值小于給定的顯著性水平α,則拒絕原假設,認為樣本來自的兩總體的分布存在顯著差異;反之。兩獨立樣本的非參數檢驗示例與操作多獨立樣本的非參數檢驗多獨立樣本的非參數檢驗:通過分析多組獨立樣本數據,推斷樣本來自的多個總體的中位數或分布是否存在顯著差異SPSS提供的多獨立樣本的非參數檢驗方法主要包括中位數檢驗Kruskal-Wallis檢驗Jonckheere-Terpstra檢驗示例多獨立樣本的非參數檢驗多獨立樣本的中位數檢驗原假設H0:多個獨立樣本來自的多個總體的中位數無顯著差異檢驗統計量和計算步驟:首先,將多個樣本混合,按升序排序,并求出混合樣本的中位數然后,分別計算各樣本中大于和小于上述中位數的樣本量最后,利用卡方檢驗方法分析各樣本來自的總體對于上述中位數的分布是否一致若多個總體的中位數無顯著差異,則這個共同的中位數應在各樣本中均處在中間位置上。每個樣本中大于該中位數與小于該中位數的樣本量應大致相同決策:如果概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為多個獨立樣本來自的多個總體的中位數存在顯著差異;反之多獨立樣本的非參數檢驗多獨立樣本的Kruskal-Wallis檢驗原假設H0:多獨立樣本來自的多個總體的分布無顯著差異檢驗統計量和計算步驟:首先,將多個樣本數據混合并按升序排序,求出各變量值的秩然后,考察各組秩的均值是否存在顯著差異如果各組秩的均值不存在顯著差異,則是多組數據充分混合,數值相差不大的結果,可以認為多個總體的分布無顯著差異;反之決策:如果概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為多個獨立樣本來自的多個總體的分布存在顯著差異;相反,多獨立樣本的非參數檢驗多獨立樣本的Jonckheere-Terpstr檢驗原假設H0:多獨立樣本來自的多個總體的分布無顯著差異檢驗統計量:計算一個樣本的觀測值小于其他樣本的觀測值的個數決策:如果概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為多個獨立樣本來自的多個總體的分布存在顯著差異;相反,多獨立樣本的非參數檢驗示例與操作兩配對樣本的非參數檢驗兩配對樣本的非參數檢驗:在對總體分布不甚了解的情況下,通過對兩配對樣本的分析,推斷樣本來自的兩個總體的分布是否存在顯著差異SPSS兩配對樣本的非參數檢驗方法,主要包括:McNemar檢驗符號檢驗Wilcoxon符號秩檢驗兩配對樣本的非參數檢驗兩配對樣本的McNemar檢驗是一種變化顯著性檢驗,它將研究對象自身作為對照者檢驗其“前后”的變化是否顯著原假設H0:兩配對樣本來自的兩總體的分布無顯著差異檢驗統計量:McNemar檢驗采用二項分布檢驗的方法,計算分布是否服從概率p為0.5的二項分布決策:若概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為兩配對樣本所來自的兩總體的分布存在顯著差異兩配對樣本的非參數檢驗示例與操作兩配對樣本的非參數檢驗兩配對樣本的符號檢驗原假設H0:兩配對樣本來自的兩總體的分布無顯著差異檢驗統計量和計算步驟:采用二項分布檢驗首先,分別用第二個樣本的各個觀測值減去第一個樣本對應的觀測值,差值為正則記為正號,差值為負則記為負號然后,將正號的個數與負號的個數進行比較若正號個數和負號個數大致相當,則可以認為第二個樣本大于第一個樣本觀測值的個數,與第二個樣本小于第一個樣本觀測值的個數是大致相當的,從總體上講,這兩個配對樣本的總體分布差距較小;反之決策:若概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為兩配對樣本所來自的兩總體的分布存在顯著差異兩配對樣本的非參數檢驗示例與操作操作步驟同兩配對樣本的McNemar檢驗,選擇【符號】選項兩配對樣本的非參數檢驗兩配對樣本的Wilcoxon符號秩檢驗原假設H0:兩配對樣本來自的兩總體的分布無顯著差異檢驗統計量和計算步驟:基于秩首先,分別用第二個樣本的各個觀測值減去第一個樣本對應的觀測值。差值為正記為正號,為負則記為負號,同時保存差值的絕對值然后,將差值的絕對值按升序排序,并求出差值的秩最后,分別計算正號秩和W+及負號秩和W-如果正號秩和與負號秩和大致相當,則說明一個樣本大于另一個樣本和該樣本小于另一個樣本的幅度大致相當,兩樣本數據差的正負變化程度基本相當,兩配對樣本來自的兩總體的分布無顯著差異決策:若概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為兩配對樣本所來自的兩總體的分布存在顯著差異兩配對樣本的非參數檢驗示例與操作操作步驟同兩配對樣本的McNemar檢驗,選擇威爾科克森(Wilcoxon)選項多配對樣本的非參數檢驗多配對樣本的非參數檢驗:通過分析多個配對樣本數據,推斷樣本來自的多個總體的中位數或分布是否存在顯著差異的方法SPSS中的多配對樣本的非參數檢驗方法,主要包括:Friedman檢驗CochranQ檢驗Kendall協同系數檢驗多配對樣本的非參數檢驗多配對樣本的Friedman檢驗:利用秩實現對多個總體分布是否存在顯著差異進行檢驗原假設H0:多個配對樣本來自的多個總體的分布無顯著差異檢驗統計量:采用類似方差分析的方法構造檢驗統計量無論觀察哪個區組,每一種處理下的數據在本區組內的秩的所有可能取值為1~k(k種處理)中的任何一個值如果k種處理不存在差異,則每一種處理下的各區組的秩和Ri(i=1,2,…k)(或平均秩)應等于其他任何一種下各區組的秩和Rj(或平均秩);反之決策:若概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為兩配對樣本所來自的兩總體的分布存在顯著差異多配對樣本的非參數檢驗示例與操作多配對樣本的非參數檢驗多配對樣本的
CochranQ檢驗:利用秩實現對多個總體分布是否存在顯著差異進行檢驗原假設H0:多個配對樣本來自的多個總體的分布無顯著差異檢驗統計量:認為每行中取1的個數是可確定的。在原假設成立的條件下,每列中出現1的概率是相等的,且這個概率值與各行中出現1的個數有關決策:若概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為兩配對樣本所來自的兩總體的分布存在顯著差異多配對樣本的非參數檢驗示例與操作操作步驟同多配對樣本的Friedman檢驗,選擇柯克蘭Q(CochranQ)選項多配對樣本的非參數檢驗多配對樣本的
Kendall協同系數檢驗:與Friedman檢驗方法相結合,可方便地實現對評判者的評判標準是否一致的分析原假設H0:評判者的評判標準不一致示例:如果利用Friedman方法檢驗出各總體的分布不存在顯著差異,即各個歌手得分的秩不存在顯著差異,則意味著評委的打分存在隨意性,評分標準不一致。第8章SPSS的相關分析相關分析繪制散點圖計算相關系數偏相關分析相關分析相關分析是分析客觀事物之間關系的數量分析方法客觀事物之間的關系大致可歸納為兩大類:函數關系和統計關系相關分析是用來分析事物之間統計關系的方法統計關系指的是兩事物之間的一種非一一對應的關系,即當一個變量x取一定值時,另一變量y無法依確定的函數取唯一確定的值統計關系可進一步劃分為線性相關關系和非線性相關關系線性相關關系又可分為正線性相關關系和負線性相關關系正線性相關關系指兩個變量線性的相隨變動方向相同負線性相關關系指兩個變量線性的相隨變動方向相反繪制散點圖和計算相關系數是相關分析最常用的工具繪制散點圖繪制散點圖:將數據以點的形式畫在直角平面上通過觀察散點圖能夠直觀發現數據點的大致走向探索變量間的統計關系以及強弱程度繪制散點圖示例和操作計算相關系數相關系數以數值的方式精確地反映了兩個變量間線性相關的強弱程度。利用相關系數進行變量間線性關系的分析的步驟第一,利用樣本數據計算樣本相關系數r樣本相關系數r反映了兩變量間線性相關程度的強弱對不同類型的變量應采用不同的相關系數指標相關系數r的取值在-1~+1之間r>0:兩變量存在正的線性相關關系;|r|>0.8:兩變量具有較強的線性相關關系;|r|<0.3:兩變量的線性相關關系較弱第二,對樣本來自的兩總體是否存在顯著的線性關系進行推斷原假設H0:兩總體無顯著線性關系,存在零相關檢驗統計量:對不同類型的變量應采用不同的檢驗統計量計算檢驗統計量的觀測值和對應的概率P-值決策計算相關系數相關系數的種類Pearson簡單相關系數Spearman等級相關系數Kendallτ相關系數Pearson簡單相關系數:用來度量兩數值型變量間的線性相關關系定義:檢驗統計量:計算相關系數Spearman等級相關系數:用來度量定序型變量間的線性相關關系計算時利用數據的秩:將兩變量的秩記為(Ui,Vi)定義:檢驗統計量:如果兩變量的相關性較強,它們秩的變化具有同步性當兩變量完全正相關時Ui=Vi如果兩變量的相關性較弱,它們秩的變化不具有同步性計算相關系數Kendallτ相關系數采用非參數檢驗方法度量定序型變量間的線性相關關系利用變量的秩計算一致對數目(U)和非一致對數目(V)如果兩變量具有較強的正相關關系,則一致對數目U應較大,非一致對數目V應較小如果兩變量具有較強的負相關關系,則一致對數目U應較小,非一致對數目V應較大如果兩變量的相關性較弱,則一致對數目U和非一致對數目V應大致相等定義:檢驗統計量:計算相關系數示例與操作偏相關分析偏相關系數也稱凈相關分析:是在控制其他變量的線性影響的條件下分析兩變量間的線性相關性計算偏相關系數(凈相關系數)一個控制變量時的
偏相關系數稱為一階偏相關系數零個控制變量時的偏相關系數稱為零階偏相關系數,即相關系數偏相關分析的步驟計算樣本的偏相關系數對樣本來自的兩總體是否存在顯著的凈相關進行推斷原假設H0:兩總體的偏相關系數與零無顯著差異選擇檢驗統計量計算檢驗統計量的觀測值和對應的概率P-值決策偏相關分析示例與操作將體脂率作為控制變量,分析體重和腰圍的相關性第9章SPSS的線性回歸分析回歸分析概述線性回歸分析和線性回歸模型回歸方程的統計檢驗多元回歸分析中的其他問題線性回歸分析的基本操作線性回歸分析的應用舉例曲線估計回歸分析概述什么是回歸分析回歸分析用于分析事物之間的統計關系,側重考察變量之間的數量變化規律,并通過回歸方程的形式描述和反映這種關系,幫助人們準確把握變量受其他一個或多個變量影響的程度,為預測提供科學依據高爾頓:回歸和回歸線如何得到回歸線--局部平均在散點圖上得到一系列(xj,yj)(j表示散點圖從左往右的第j個小區間)對應的數據點如果這些點足夠多,則可以得到一條光滑的曲線---回歸線的近似線回歸線是局部平均的結果回歸分析概述如何得到回歸線---函數擬合,基本思路首先,通過散點圖觀察變量之間的統計關系,得到對回歸線形狀(線性關系或非線性關系)的直觀認知,并確定一個能夠反映和擬合這種認知且最簡潔的(參數最少的)數學形式(線性函數或非線性函數),即回歸模型其次,利用樣本數據在一定的統計擬合準則下,估計出回歸模型中的各個參數,得到一個確定的回歸方程最后,對回歸方程進行各種檢驗,判斷該方程是否真實地反映了事物總體間的統計關系回歸分析概述回歸分析的一般步驟確定回歸分析中的解釋變量x和被解釋變量y確定回歸模型建立回歸方程對回歸方程進行各種檢驗利用回歸方程進行預測等線性回歸分析和線性回歸模型觀察被解釋變量y和一個或多個解釋變量xi的散點圖當發現y與xi
之間呈現出顯著的線性關系時,則應采用線性回歸分析的方法,建立y關于xi的線性回歸模型根據解釋變量的個數,線性回歸模型可分為:一元線性回歸模型,對應一元線性回歸分析多元線性回歸模型,對應多元線性回歸分析線性回歸分析和線性回歸模型一元線性回歸模型一元線性回歸模型是指只有一個解釋變量的線性回歸模型,用于揭示被解釋變量與另一個解釋變量之間的線性關系對應一條回歸直線線性回歸分析和線性回歸模型多元線性回歸模型多元線性回歸模型是指含有多個解釋變量的線性回歸模型,用于揭示被解釋變量與其他多個解釋變量之間的線性關系對應一個回歸平面線性回歸分析和線性回歸模型參數的普通最小二乘估計對于一元線性回歸方程對于多元線性回歸方程回歸方程的統計檢驗回歸方程的統計檢驗,主要包括:回歸方程的擬合優度檢驗回歸方程的顯著性檢驗回歸系數的顯著性檢驗殘差分析擬合優度檢驗:檢驗樣本數據點聚集在回歸線周圍的密集程度,評價回歸方程對樣本數據的擬合基本思路:y的各觀測值與均值的總差異源于兩方面解釋變量x取值不同其他隨機因素表述為:離差平方和=回歸平方和+剩余平方和回歸方程的統計檢驗擬合優度檢驗:檢驗樣本數據點聚集在回歸線周圍的密集程度,評價回歸方程對樣本數據的擬合對于一元線性回歸方程:R2統計量R2的取值在0~1之間。R2越接近1,說明回歸方程對樣本數據點的擬合優度越高;R2越接近0,說明回歸方程對樣本數據點的擬合優度越低離差平方和=回歸平方和+剩余平方和SST=SSR+SSE回歸方程的統計檢驗擬合優度檢驗:檢驗樣本數據點聚集在回歸線周圍的密集程度,評價回歸方程對樣本數據的擬合對于多元線性回歸方程:調整的R2統計量調整的R2的取值在0~1之間為什么采用調整的R2?剔除解釋變量增加帶來的“虛假”擬合離差平方和=回歸平方和+剩余平方和SST=SSR+SSE回歸方程的顯著性檢驗回歸方程的顯著性檢驗:檢驗被解釋變量與所有解釋變量之間的線性關系是否顯著,用線性模型來描述它們之間的關系是否恰當對于一元線性回歸方程原假設H0:β1=0,即回歸系數與零無顯著差異,意味著:當回歸系數為零時,無論x的取值如何變化都不會引起y的線性變化,x無法解釋y的線性變化,即它們之間不存在線性關系檢驗統計量:F統計量計算檢驗統計量的觀測值和對應的概率P-值決策:若概率P-值小于給定的顯著性水平α,則應拒絕原假設,回歸系數與零存在顯著差異,被解釋變量y與解釋變量x的線性關系顯著,可以用線性模型描述和反映它們之間的關系;反之回歸方程的顯著性檢驗回歸方程的顯著性檢驗:對于多元線性回歸方程原假設H0:β1=β2=…=βp=0,即各個偏回歸系數同時與零無顯著差異,意味著:當偏回歸系數同時為零時,無論各個x取值如何變化都不會引起y的線性變化,所有x無法解釋y的線性變化,y與x的全體不存在線性關系檢驗統計量:F統計量計算檢驗統計量的觀測值和對應的概率P-值決策:若概率P-值小于給定的顯著性水平α,則應拒絕原假設,偏回歸系數不同時為零,被解釋變量y與解釋變量x的全體的線性關系顯著,可以用線性模型描述和反映它們之間的關系;反之回歸系數的顯著性檢驗回歸系數的顯著性檢驗:研究回歸方程中的每個解釋變量與能否有效地解釋被解釋變量的線性變化,它們能否保留在線性回歸方程中對于一元線性回歸方程原假設H0:β1=0,即回歸系數與零無顯著差異,意味著:當回歸系數為零時,無論x取值如何變化都不會引起y的線性變化,x無法解釋y的線性變化,它們之間不存在線性關系檢驗統計量:計算檢驗統計量的觀測值和對應的概率P-值決策:若概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為回歸系數與零有顯著差異,被解釋變量y與解釋變量x的線性關系顯著,x應該保留在回歸方程中;反之回歸系數的顯著性檢驗回歸系數的顯著性檢驗:對于多元線性回歸方程原假設H0:βi=0,即回歸系數與零無顯著差異,意味著:當回歸系數為零時,無論xi取值如何變化都不會引起y的線性變化,xi無法解釋y的線性變化,它們之間不存在線性關系檢驗統計量:計算檢驗統計量的觀測值和對應的概率P-值決策:若概率P-值小于給定的顯著性水平α,則應拒絕原假設,認為回歸系數與零有顯著差異,被解釋變量y與解釋變量xi的線性關系顯著,xi應該保留在回歸方程中;反之殘差分析殘差分析的對象:殘差--指由回歸方程計算所得的預測值與實際樣本值之間的差距出發點:如果回歸方程能夠較好地反映被解釋變量的特征和變化規律,那么殘差序列中應不包含明顯的規律性和趨勢性主要任務:殘差是否為服從均值為零的正態分布殘差是否服從等方差的正態分布殘差序列是否獨立探測樣本中的異常值殘差分析殘差均值為零的正態性分析繪制殘差圖殘差的獨立性分析殘差序列應滿足cov(εi,εj)=0(i≠j),表示殘差序列的前期和后期之間不存在相關關系,即不存在自相關殘差序列存在自相關會帶來許多問題如果殘差的均值為零,殘差圖中的點應在縱坐標為零的橫線上下隨機散落殘差分析殘差的獨立性分析工具繪制殘差序列圖:殘差隨著時間的推移不應呈現規律性計算殘差的自相關系數DW檢驗:推斷小樣本序列是否存在自相關殘差分析異方差分析解釋變量取怎樣的值,對應殘差的方差都應相等,方差不應隨解釋變量或被解釋變量預測值的變化而變化;否則認為出現了異方差現象當存在異方差時,參數的最小二乘估計不再是最小方差無偏估計異方差分析的工具繪制殘差圖計算等級相關分析殘差分析探測樣本中的異常值通常異常值是指那些遠離均值的數據點,對回歸方程的參數估計有較大影響,應盡量找出它們并加以排除被解釋變量y和解釋變量x中都有可能出現異常值異常值的探測方法一般方法計算標準化殘差:絕對值大于3對應的觀測值為異常值學生化殘差:絕對值大于3對應的觀測值為異常值剔除殘差:在計算第i個觀測的殘差時,用剔除該觀測后剩余的n-1個觀測擬合回歸方程,并計算第i個觀測的預測值和相應的殘差。這個殘差與第i個觀測無關,不受第i個觀測y值是不是異常值的影響,稱為剔除殘差剔除殘差更能如實反映第i個觀測的y的異常性絕對值大于3對應的觀測值為異常值多元回歸分析中的其他解釋變量的篩選問題并非引入的解釋變量越多越好,有必要采取一些策略對解釋變量引入回歸方程加以控制和篩選解釋變量篩選的一般策略向前篩選:解釋變量不斷進入回歸方程的過程向后篩選:解釋變量不斷剔除出回歸方程的過程逐步篩選:向前篩選和向后篩選策略的綜合多元回歸分析中的其他變量的多重共線性問題多重共線性:是指解釋變量之間存在線性相關關系的現象解釋變量間高度的多重共線性會給回歸方程帶來許多影響測度解釋變量間的多重共線性一般方式容忍度:方差膨脹因子:取值范圍在0~1之間,越接近0,表示多重共線性越強;越接近1,表示多重共線性越弱方差膨脹因子的取值大于等于1。解釋變量間的多重共線性越弱,VIF越接近1;解釋變量間的多重共線性越強,VIFi越大通常,如果VIFi大于等于10,說明解釋變量xi與方程中其余解釋變量之間有嚴重的多重共線性線性回歸分析的基本操作和應用舉例
線性回歸分析的基本操作和應用舉例核心操作回歸方程的檢驗和殘差分析線性回歸分析的基本操作和應用舉例帶虛擬自變量的回歸分析示例生成虛擬自變量:是男性嗎最后得到的估計的回歸方程:進一步:曲線估計曲線估計:解決本質線性關系的回歸問題例如:曲線估計示例和操作第10章SPSS的聚類分析聚類分析的一般問題層次聚類K-Means聚類聚類分析的一般問題聚類分析:研究“物以類聚”問題的多元統計分析方法聚類分析:是一種建立分類的多元統計分析方法能夠將一批觀測(或變量)數據根據其諸多特征,按照在性質上的親疏程度,在沒有先驗知識的情況下進行自動分類—聚類解類內部個體特征具有相似性,不同類間個體特征的差異性較大示例:聚類分析的一般問題聚類分析中“親疏程度”的度量--個體間差異程度的測度:距離先將每個觀測數據看成p維(p個聚類變量)空間上的一個點數值型變量個體間距離的常見計算方式歐氏距離平方歐氏距離切比雪夫距離聚類分析的一般問題二值變量個體間距離的計算方式簡單匹配系數Jaccard系數聚類分析的一般問題聚類分析的幾點說明所選擇的變量應迎合聚類的分析目標各變量的變量值不應有數量級上的差異各變量間不應有較強的線性相關關系層次聚類層次聚類的兩種類型Q型聚類:對觀測進行聚類,使具有相似特征的觀測聚集在一起,使差異性大的觀測分離開來R型聚類:對變量進行聚類,使差異性大的變量分離開來,具有相似性的變量聚集在一起可在相似變量中選擇少數具有代表性的變量參與其他分析,實現減少變量個數和變量降維的目的層次聚類層次聚類的常用方式:凝聚方式聚類首先,每個觀測個體自成一類然后,按照某種方法度量所有個體間的“親疏程度”,并將其中最“親密”的個體聚成一小類,形成n-1個類;接下來,再次度量剩余觀測個體和小類間的“親疏程度”,并將當前最親密的個體或小類再聚成一類;重復上述過程,不斷將所有個體和小類聚集成越來越大的類,直到所有個體聚到一起,形成一個最大的類為止可見,在凝聚方式聚類過程中,隨著聚類的進行,類內的“親密”程度在逐漸降低對n個觀測個體,通過n-1步可凝聚成一大類層次聚類個體與小類、小類與小類間“親疏程度”的常用度量方法個體與小類間的最近鄰距離:該個體與小類中每個個體距離的最小值個體與小類間的最遠鄰距離:該個體與小類中每個個體距離的最大值個體與小類間的組間平均鏈鎖:該個體與小類中每個個體距離的平均值個體與小類間的組內平均鏈鎖:該個體與小類中每個個體距離以及小類內各個體間距離的平均值層次聚類分析基本操作K-Means聚類K-Means聚類,也稱快速聚類,仍將數據看成p維空間上的點,以距離作為測度個體“親疏程度”的指標,算法效率高K-Means聚類分析的核心步驟如下:第一步,指定聚類數目K第二步,確定K個初始類中心點,一般方式:用戶指定方式系統指定方式第三步,根據距離最近原則進行分類依次計算每個數據點到K個類中心點的歐氏距離,并按照與K個類中心點距離最短的原則將所有觀測分派到K個分類中第四步,重新確定K個類中心點:均值點第五步,判斷是否已經滿足終止聚類分析的條件。若未滿足重復第三四步K-Means聚類K-Means重復多次迭代的目的K-Means聚類示例與操作第11章SPSS的因子分析因子分析概述因子分析的基本內容因子分析的基本操作及案例因子分析概述因子分析:以最少的信息丟失為前提,將眾多的原有變量綜合成較少的幾個綜合指標,名為因子因子分析的意義:實現變量降維因子的特點:因子個數遠遠少于原有變量的個數因子能夠反映原有變量的絕大部分信息因子之間的線性關系不顯著因子具有命名解釋性因子分析概述因子分析的數學模型矩陣形式的表示:F稱為因子,又稱為公共因子,fj(j=1,2,…,k)彼此不相關A稱為因子載荷矩陣,aij(i=1,2,…,p;j=1,2,…,k)稱為因子載荷,是第i個原有變量在第j個因子上的載荷ε稱為特殊因子,表示原有變量不能被因子解釋的部分,其均值為0,獨立于fj(j=1,2,…,k)p個原有變量x1,…,xp且每個變量(經標準化處理后)的均值為0,標準差均為1因子分析概述因子分析中的重要概念因子載荷aij在因子不相關的前提下,aij是變量xi與因子fj的相關系數,反映了變量xi與因子fj的相關程度因子載荷aij的平方反映了因子fj對解釋變量xi的重要作用和程度變量共同度即變量方差,是全部因子對變量xi方差解釋說明的比例,體現了全部因子對變量xi的解釋貢獻程度,越接近1越好,意味折變量xi方差丟失少因子的方差貢獻方差貢獻反映了因子fj對原有變量總方差的解釋能力。越高說明相應因子的重要性越高因子分析的基本內容因子分析的基本步驟因子分析的前提條件判斷分析原有變量是否存在相關關系,是否適合進行因子分析因子提取將原有變量綜合成少數幾個因子,是因子分析的核心內容使因子具有命名解釋性通過各種方法使提取出的因子實際含義清晰,使因子具有命名解釋性計算各觀測的因子得分通過各種方法計算各觀測在各因子上的得分,為進一步的分析奠定基礎因子分析的基本內容因子分析的前提條件判斷,方法:計算相關系數矩陣計算反映像相關矩陣矩陣第i行對角線上的元素為變量xi的MSAiMSAi值越接近1,意味著變量xi與其他變量間的相關性越強其他大多數元素的絕對值均較小,對角線上元素的值較接近1,說明變量的相關性較強,適合進行因子分析巴特利特球度檢驗原假設H0:相關系數矩陣是單位陣KMO檢驗,常用的KMO度量標準0.9以上非常適合;0.8適合;0.7一般0.6不太適合;0.5以下極不適合因子分析的基本內容因子提取和因子載荷矩陣的求解因子分析的關鍵是根據樣本數據求解因子載荷矩陣因子載荷矩陣的最常用求解方法:主成分分析法主成分分析法:通過坐標變換,將原有的p個相關變量xi(標準化后)做線性組合,轉換成另一組不相關的變量yi:其中:因子分析的基本內容因子載荷矩陣的求解原則根據上述原則確定的變量y1,y2,y3,…,yp依次稱為原有變量x1,x2,x3,…,xp
的第1,2,3,…,p個主成分y1在總方差中所占比例最大,體現原有變量方差的能力最強y2,y3,…,yp在總方差中所占比例依次遞減,體現原有變量方差的能力依次減弱因子分析的基本內容因子載荷矩陣的求解原則從幾何意義的角度理解,例如:因子分析的基本內容因子載荷矩陣的求解的基本步驟因子載荷陣因子分析的基本內容因子載荷矩陣的求解的基本步驟包含k個因子的因子載荷矩陣:確定因子個數k根據特征值λj確定因子數:選取特征值大于1的因子,即應至少解釋1個方差根據因子的累計方差貢獻率確定因子數:選取累計方差貢獻率大于0.85時的特征值個數為因子個數k因子分析的基本內容因子的命名:使因子的實際含義更清晰通過旋轉方式,使一個變量只在盡可能少的因子上有比較高的載荷最理想狀態下,使某個變量xi在某個因子fj上的載荷趨于1,在其他因子上的載荷趨于0。這樣,因子fj就能夠成為某個變量xi
的典型代表,因子的實際含義也就清楚了因子旋轉:將因子載荷矩陣A右乘一個正交矩陣τ后得到一個新的矩陣B因子分析的基本內容計算因子得分:計算每個觀測在各因子上的具體取值,這些取值稱為因子得分,形成的變量稱為因子得分變量用原有變量來描述因子得分變量,第i個觀測在第j個因子上取值可表示為:因子得分是原有變量線性組合的結果,是各變量值的加權w平均,權數的大小表示變量對因子得分變量的重要程度因子分析的基本操作及案例示例及操作第12章SPSS的判別分析判別分析概述距離判別法Fisher判別法貝葉斯判別法判別分析的應用判別分析概述判別分析:用于對分類型變量取值的分析和預測在已有樣本數據的基礎上,分析類別變量與判別變量之間的數量關系,建立判別函數,最終實現對新數據類別變量取值的預測用于判別的變量稱為判別變量被預測的變量稱為類別變量根據所采用的數學模型,判別分析分為:線性判別分析非線性判別分析根據判別準則,判別分析分為:距離判別法Fisher判別法貝葉斯判別法距離判別法距離判別:以距離為依據實現判別的方法基本思路:設類別變量有k個類別,且有分別來自k(k≥2)個類別總體的k個樣本,每個樣本都有若干個判別變量為x1,x2,…,xp(p>k)的觀測值,且判別變量均為數值型,并服從正態分布首先,將樣本數據看成p(p個判別變量)維空間中的點然后,分別計算出k個樣本各判別變量的均值,作為k個類別的中心;最后,計算新數據點到各類別中心的馬氏距離,并根據距離最近的原則,新數據點距離哪個類別中心近則屬于哪個類別距離判別法計算示例:數據點X到總體Gi的平方馬氏距離:距離判別法計算示例:距離判別法
距離判別法判別函數的幾何理解W(X)=0代表的是能夠分隔兩類總體的一條線或平面或超平面落在其上的數據點,判別函數值為0,形成的點軌跡如下圖橢圓給出了數據點分布的大致輪廓左圖為判別變量x1和x2
不相關的情況右圖為判別變量x1和x2
相
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 2027屆隴南地區康縣四上數學期末統考試題含解析
- 儀征市2027屆數學三上期末復習檢測模擬試題含解析
- 2027屆四川省瀘州市龍馬潭區四上數學期末學業水平測試模擬試題含解析
- 2027年山東汶上職業學院高職單招職業技能考試題庫附答案詳解(典型題)
- 2027年陜西航空職業技術學院高職單招職業適應性測試考試題庫及答案詳解(有一套)
- 2027年四川鐵道職業學院高職單招職業技能考試題庫及參考答案詳解(模擬題)
- 2025年沙澧河職業學院單招綜合素質考試模擬試卷【含答案詳解】
- 2024年湖南鐵航信息職業學院高職單招職業技能考試題庫【滿分必刷】附答案詳解
- 2025年陜西岐山職業學院單招職業技能考試題庫附答案詳解(黃金題型)
- 2024年阿爾山職業學院單招職業技能考試題庫附答案詳解【突破訓練】
- 2026江西上饒市機關事業單位招聘編外聘用人員55人重點基礎提升(共500題)附帶答案詳解
- GA/T 1043-2025智能交通管理系統前端設備運行維護規范
- 2026年梅州市梅江區五年級數學第二學期期末學業水平測試試題含答案含解析
- 2026年單招園林技術試題及答案
- 四川綿陽市2026年從‘五方面人員’中選拔鄉鎮領導班子成員考試試題及答案
- 碼頭防汛防臺工作制度
- 高空作業車安全檢查表、維護保養表
- 門診手術室全套工作制度
- 部編版語文四年級上學期《期中檢測卷》含答案
- 2026年九州職業技術學院單招職業適應性測試題庫有答案詳細解析
- 受限空間監護人培訓課件
評論
0/150
提交評論