Please enable JavaScript.
Coggle requires JavaScript to display documents.
信度與效度 (資料分析方式), 信度與效度的關係, 信度與效度, 設計測量工具 - Coggle Diagram
信度與效度
(資料分析方式)
表面效度
face validity
意義
1、「在研究
測量工具的外型
上,研究工具是否可測量到我們所欲測量的特質或行為」
3、一份測驗或研究工具從
外表上看起來似乎可以適切的測量所欲測的特質或行為
,即稱該測驗或研究工具具有表面效度
高表面效度,是為了讓受測者更清晰的了解測驗或評量,使受試者更容易清楚且正確的做出回答
最簡單也最原始的效度指標
2、研究工具的
題目或是形式等外
型上
給受試者的主觀印象
缺點
具有
主觀性
,且
缺乏實證上的根據
測驗或研究工具可能具有很高的表面效度,但實際上卻不具有任何理論根據的效度意義
表面效度與內容效度之相同處
是研究者的
主觀認定歷程
;
題目要都能反映
出
測驗或研究的目的
從
外表直接地觀察
測量題目與測量目標的一致程度,可從其內容是否已經涵蓋概念的所有內含或符合邏輯來判斷
例如,要衡量一個人吸毒的習慣,可以設計一題「你多久吸食大麻一次?」作代表,可表現出一個人吸食大麻的習慣
表面效度與內容效度的
缺點(限制)
1、缺乏
客觀性
;2、
無法測量
所欲測量目的之
所有向度
例如,犯罪傾向應該包含人格、環境、社會、心理等向度,但僅使用
人格特質測量
受試者的犯罪傾向,即使該人格主題取得極高的表面或內容效度,卻
無法真實測量
到我們所欲測量的犯罪傾向特質的全部向度
內容效度
content validity
意義
以
邏輯判斷法
來
決定測驗是否具有內容代表性的指標
驗證方法
針對測量工具中的「每一個題目」,進行概念上是否與整份測驗的
目的有關聯的主觀認定
內容是否有
涵蓋概念的所有內含
或
符合邏輯
來判斷
建構效度
construct validity
意義
有
邏輯推論
又有
統計架構支持
的效度驗證方法,也稱為
因素效度factorial validity
。
1、協助驗證一些
無法經由外顯行為標準
,加以測量的
受試者的內在、潛在心理特質
2、測量題目
是否能測量到理論的概念或特質,
也稱為
理論效度
缺點(限制)
1.針對某一個特殊向度測量,但
因素分析結果顯示出複數個因子
,效度驗證遭受到質疑
2.因子分析需要選擇較高深的統計運算技巧,雖現在有統計軟體協助,但仍要注意
統計程序設定錯誤
的效度驗證危機
3建構效度的驗證邏輯本身,測量題目
不一定可以反映出受試者直接的感受或態度
驗證方法
運用在
關於態度、人格、認知等測量人類內在心靈運作歷程
的測量工具上
因研究者無法
直接從外顯表現來測量受試者的內在心理運作
因此一份具有高建構效度的測量工具,能夠有效的測量,其所想要測量的內在心理運作歷程
建構效度的驗證方法為
行為統計方法中的「因素分析」
factor analysis
因素分析,係
決定測量工具的基本組成成分的
統計方法
例如,測量警察專業性認知,得到三個因素:正規警察教育表現、領導統御職能、升遷動機
實證效度pragmatic valadity
(實證要同時預測)
預測效度
predictive validity
驗證方法
測量結果是否可以有效的預測受試者
未來或是接續的行為表現
,又稱為
效標關聯效度criterion validity
是一種將
測量工具所量測到的分數結果
與
受試者日後行為
進行一種簡單相關
當測量工具
的量測結果
與
量測的行為間
有高度相關時,便得到預測效度的證據
效標
意義
測量工具
所欲測特質的一種理想樣本
,足以用來
考驗測量工具分數真確性的外在標準
例如,測量青少年吸食毒品的態度,量測結果與該受試者「成年後」是否會出現吸食毒品行為的關係,提供預測效度的證據線索
同時效度
concurrent validity
意義
概念及運算方法與預測效度類似,不同的是,同時效度在
測量的同時
,
一起針對效標行為進行資料蒐集
(
測量加上蒐集資料
)
例如,測量青少年吸食毒品的「態度」,同時間蒐集該群青少年吸食毒品的「行為證據」,則該量測結果與該群青少年吸食毒品行為間的關係,即為同時效度
測量工具
所量測出來的分數
,是否與受試者
在另一個測量工具表現上有高相關
限制
1.測量工具所得到的
量測結果
與
效標行為之間的關係
是否能夠作為
正確且適當的效度證據
即使得到很高的相關(高效度證據),也沒辦法
推論受試者的行為,是所測量的態度或是認知所塑造成
2.
態度或認知測量的提問
往往較抽象或間接,是否適合拿來與直接可
測量外顯行為效標作相關
折半信度
spilt-half reliability
意義
將一份測量工具運用客觀的方式,將
題目區分成相等的兩個部分
,再將兩個部分
求取相關
,該相關係數即為折半信度
因只需要使用相同的測量工具施測一次,並沒有複本或是時間取樣上的誤差,
又稱內部一致性係數internal consistency coefficient
限制
若將測量工具前後折半,後半段受試者的表現明顯會受到測量效應影響而導致分數上升,導致折半信度被低估
使用方法
1、前後折半(前半段題目及後半段題目分段)
2、奇偶折半(奇數題偶數題分段)等兩種方式
效度
表示研究的有效性
一項測驗在
測量其所欲測的特質或行為時,所具有的真確性
例如,每次射擊都能正中「靶心」、精準度;
測驗或研究可以很
正確且真實的測量
出
研究所想要測量的特質或行為
,該測驗或研究具有高效度(測量工具能測量到所欲測量的結果)
記憶法:表面內容去建構實證
所得的資料是否
與測量的目標吻合
,也就是測量工具是否能
正確、準確的代表概念的程度
再測信度
test-retest reliability
意義/驗證方法
使用
同一份測量工具
對同一組受試者
在不同時間
進行前後兩次施測,兩次量測結果間的相關即為再測信度
當前後兩次的測量結果間有高相關(相關係數達到0.8以上的水準),具有高再測信度
限制
同一份測驗實施第二次施策,可能有
「測量效應」
,因為
受測者已了解題目、施測目的等
,影響受測者對題目做正確或典型的作答判斷
難控制兩次施測時間間隔所發生的隨機誤差,因此再測信度容易
受到時間變數的影響
而產生變化
複本信度
alternate form reliability
意義
當同一測量工具
有兩種或以上的複本
時,研究者可將兩種複本
分別實施於同一群受試者
,再以
Pearson r法
(統計學方法)計算兩複本
測量結果分數的相關係數
,該相關係數為複本信度
複本
,指無論在內容、試題、形式、編制方法、實施步驟和評分標準上,皆
與原測量工具一致的另一種測量工具
可適度解決再測信度的「測量效應」問題
研究者使用
幾乎一致的
兩套測量工具(原工具、複本工具)來對同一群受試者進行量測,若兩個量測結果有高相關,研究者便可宣稱該測量工具有高複本信度
限制
1、
複本編制不易
,高度相似的複本也是和原本的測驗有些微的差異
2、
複本內容與原本內容間的差異
,又稱為
「內容取樣差異」
,微小的差異可能造成試題涵蓋度之變化
3、複本實施的
時間間隔、練習效果、學習轉移或施測順序
等,都可能是
誤差來源
信度對於測量工具之重要性
1、信度是測量工具
效度指標
的必要條件
2、研究者可從信度證據來
決定自己的不同測量特質間的效果
測量工具如果不能提供穩定的測驗結果,該結果便容易遭到懷疑
信度
測量的穩定性
測量工具的穩定性及一致性
測量工具是否
每次都能測量到相同的結果
,也就是工具
反覆使用後,是否能測到一致、穩定的結果
。
例如,「每次射擊都能夠穩定」射中靶心、穩定度;不管測幾次,結果都差不多一樣
換言之,
任何人用同一測量工具均測到相似的結果
,該測量工具就符合
客觀
的標準
一份具有信度的測量工具可以幫助釐清不同特質間的效果
如果用相同的方法重複測量變相所得的資料都是一致,表示該變相的測量信度很高
評分者間信度
scorer reliability
將
同一份測量結果交給兩位不同、獨立的評分(檢驗)者進行獨立計分
,將每一位受試者所得的來自於兩個不同評分者的得分依照一般的方式
求取相關
可以確認自己的測量或實驗
是否具客觀性
例如,為了解大陸非法入境者的偷渡動機,針對受訪者的
記述內容進行分析、編碼coding(分類)
,可以
請另一位獨立的研究者對相同的記述內容重複一次編碼分類的工作
若兩位評分者的
編碼分類內容有高度相關
,研究者便可以得到
高評分者間信度的編碼工具規則
穩定性(信度)成立前題
人類的各
項心理運作歷程(智力、態度、認知)
等都具有一定程度的穩定性
例如,測量出IQ180,半年後再使用同一智力測驗測試,智力的表現不會距離IQ180太遠
信度與效度的關係
影響因素
記憶法:使用個人的工具來讓研究者解釋環境
測量工具本身
測驗的
時間
長度
過長的測驗
,容易導致受試者
疲勞或厭煩
,而出現不正常、忽略或非典型的作答反應
測驗內容的
用字遣詞
文句陳述的品質
會影響信度及效度,名詞
意義解釋的不同
、
偏見性的字眼
帶來不悅反應等
開放式問題或固定答案
式問題
開放式能要求受試者
盡可能回答自我想法,達到更多資訊
,但
受限於受試者的教育水準或表達能力
,若受試者無法理解問題涵義或缺乏表達能力,而無法將自己的想法做適當描述
測量
工具的錯誤
打字錯誤、排版不佳等測量工具的外型特徵
,影響受試者的興趣及耐心
環境因素
不同的施測方式
所造成的影響
測驗
指導的清晰度
研究者
無法明確掌控測量的進程時
(自己不清楚研究內容、方向),受試者容易出現誤差的表現
面談或自陳式問卷
面對面進行訪談
,會帶來較大的壓力感而導致不典型反應;
自陳式問卷
可以給受試者帶來
匿名的安全
感,而能放心作答
個人因素
受試者的
人口屬性特性
對測量工具的信效度的威脅(地位、年齡性別、背景、記憶、期望)
受試者的年齡、性別、發展水準
影響受試者的
認知與態度
不同的性別、年齡或發展階段的受試者,對相同的研究議題,有
不同的興趣及回答
宗教、種族背景
須
注意測驗詞句
可能造成的偏見及文化公平性
記憶
受試者的記憶能力
例如,對記憶力好的受測者,對他施以同一份測驗的第二次施測,結果可能只反應受試者對第一次測驗的記憶,而非反應受試者真實的作答傾向
時間間隔的掌控及設計
是減少記憶影響的課題(例如再測信度)
社會期望
為符合社會的期望標準,而
不使用、不願意面對自己本身實際的(負面)人格特質、行為表徵
做測量,而扮演所謂的好人、正常、一般的回答
受試者的社經地位
職業、教育程度、收入、種族等基本的人
口屬性特性
所決定,會影響受試者
對於測量目的及議題的態度
(想法不同)
編制具有文化背景因素的測量工具時,
應需要注意文化公平性
研究者的解釋
使用測量工具時
所犯的錯誤或疏失
對測量工具信效度的影響
對於原始數據的
過度解釋
對測量工具的原始分數
進行過度解釋,並不能提供
太多有意義的訊息
例如,
比較式的研究
,原始數據往往
需經過彼此比較才能顯現出
測量工具的有效性及可信度
編碼
程序
將自己的測量工具進行編碼、分類,其編碼與分類的過程有可能造成
過於主觀
,而影響個人工具的效度與信度
可使用
多位研究者互相評量的方式
,
避免過於主觀的情形發生
有效的測量工具,一定可信
研究者可以確認自己的測量工具可以測到所欲測的行為或特質時,該測量工具是穩定且一致的
沒有效的測量工具,可能可信,可能不可信
當欲測量特質X,但無法有效測量特質X時,
1.是完全無效的測量工具;2.測量工具對特質X沒效度,但對特質Y可能是有效、可信的測量工具
可信的測量工具,可能有效,可能無效
使用測量工具對特質X進行測量,可以得到一致且穩定的結果,但特質X不是我們所欲測量的特質(不具備有效性)
不可信的測量工具,一定沒有效
信度是效度的必要條件,沒有信度的測量工具,一定沒有效度可言
(不知道測量工具測到什麼特質,但它的確是穩定的)
信度與效度
信、效度之檢驗
信度
計算
測量
工具的信度係數(折半、再測、評分者間、複本)
效度
1、請一批專家就測量工具
的內容進行表面效度的主觀判斷
,然後刪修問卷內容
2、採用統計上
的因素分析法,
檢驗建構效度,觀察分析結果,比較設計的問卷與理論概念之間的吻合度
需要透過邏輯或統計方面的指標來檢驗
結論
一份可信的測量工具可以確保測量結果是有效的,因此在設計量化測量工具時,必須能夠對測量工具的信度及效度進行檢驗,以保持測量工具的可信度及有效度
前言
如何獲得有代表性的樣本與資料,提供研究者進行正確可靠的研究分析,故要檢驗研究的信度及效度,
設計測量工具
考量測量的數學特性
類別或名義尺度
把事物進行最簡單的分類,變項的每一個值都構成一個類別;只有類別上的差異,沒有數量上的差異
例如,台灣將人分為原住民、閩南人、客家人、大陸省籍、外國籍等
順序或等級尺度
用來分類有順序的事物;測量態度與感覺
例如,把受訪者分為上、中、下三個階層;測量受訪者對警察的信心,分為沒信心、有點沒信心、有信心、非常有信心等
可以透過順序層次的分類,測量到特定感覺或態度的順序差異,但每一個類別之間雖有順序之別,卻無法知道距離是否相等,距離涉及受訪者的主觀感受,無客觀標準
等距尺度
除了具有類別與順序衡量的特質,每個類別之間的距離是相等
例如,測量西元2000年、2001年、2002年等三年間之犯罪率
等比尺度
性質與等距尺度相同,差異在「零」是有意義,代表該測量對象缺乏某種性質或某種性質的不存在
例如,零歲代表未出生的胚胎,或前科次數、酒精含量等
給予「測量」一個「概念定義」,將定義為「將概念轉化為一組數字或給予標示的過程」
例如,總體犯罪率,研究者蒐集到所屬各國的人口數及警方登錄的刑案發生數,可以根據這些數字計算出各國的總體犯罪率