跳到主要內容
:::

生成式人工智慧在領導評量之應用

測驗及評量研究中心 | 謝名娟 研究員兼中心主任

  近幾年,人工智慧的發展突飛猛進,如ChatGPT這類AI工具,已經不只是聊天機器人了,它可以寫文章、改作文,甚至幫忙評分。這樣的技術讓人開始思考:教育現場是不是也可以善用AI,來改善目常見的評量困境。以校長儲訓課程為例,學員除了上課,還要繳交作業。這些作業通常是由師傅校長(也就是陪伴學員的指導者)和一些外聘的專家老師來評分。但實務上,這些評分者不只要看大量的作業,還要兼顧回饋建議。由於人力有限、時間緊迫,常常只能給出一個分數,卻沒辦法提供足夠的文字回饋。更重要的是,師傅校長和學員相處一段時間後,容易產生感情或熟悉度,無形中會出現所謂的「月暈效應」,不夠客觀的評分與回饋。

  因此,若能引進像ChatGPT這樣的AI工具來幫忙,就可能解決這個問題。ChatGPT可以依照設定好的評分標準來打分數,還能快速給出條理清楚的建議,不會因為認識學員而產生偏差,而且可以幫忙補上人力不足的部分。

  不過,AI到底能不能像人一樣準確地理解作業內容?本研究的目標,就是要實際測試看看ChatGPT在評量校長學員作業時的表現,並跟真人評分者做比較。

一、研究重點是甚麼?

  本研究之重點主要為探究AI和真人給的分數差異多少?兩者在各評分項目(例如願景形塑、系統思考、個人反思等)之間的關聯性有沒有不一樣?AI的評分穩不穩定、可不可靠?如果ChatGPT的表現夠穩定、有邏輯,未來就可能成為評量制度的好幫手,提升回饋品質,甚至讓學員更清楚知道自己哪裡該進步。

  這項研究不只是試驗AI能不能評分而已,更是希望透過人機合作的方式,讓教育評量更公平、更有效,也讓學習過程中的每一份作業都能得到有意義的回饋。

二、評估的對象是誰?怎麼進行調查?

  本研究的對象是參加校長儲訓課程的學員共131位,其中包含59位女性與72位男性,平均年齡約47歲,平均教育年資達21年。他們在參與儲訓課程的過程中,須完成一份校務精進計畫,內容涵蓋對學校現況的分析、願景擬定、策略設計、課程規劃與個人反思等,屬於一份深具領導思維與行動能力展現的作業,這份作業也是本研究中AI與人類評分者所共同評估的重點文本。

  每份作業至少有兩位內評與一位外評者,以確保評分公平。而本研究則引入ChatGPT模型,讓AI也對這些文本進行獨立評分,並與人評結果進行全面比較與分析。

三、研究的發現有哪些?

  在評分分數的傾向上,發現人類評分者普遍給予較高的分數,且分數分布較廣,可能與熟識學員、鼓勵學習等情感因素有關。相較之下,ChatGPT的評分較為保守、平均,且分布集中,顯示其在評分過程中較為「一致」與「中性」,不易受人際關係影響。

  從評分構面之間的邏輯關聯性來看,人類評分者在不同構面之間的相關性偏高,顯示他們較傾向從整體印象或連貫性來評分。反觀ChatGPT則是逐一依據評分規準分析每一構面,呈現出更明確的區分與條理,展現其「準則導向」的評量邏輯。

  在評分一致性與信度方面,不論是真人評或AI評分,兩者的信度皆達到高度一致。這顯示在適當的設計與校準下,ChatGPT可提供具穩定性與重現性的評分結果,具備實際應用價值。

  另外,ChatGPT所提供的回饋,發現其回饋多具有明確的結構,常採用「先肯定、再建議」的模式,語氣溫和,內容具體,能有效幫助學員了解自己的優勢與可改進之處。師傅校長普遍認為AI回饋能補足真人評分的時間壓力與盲點,對學員而言也更容易接納。

  然而,AI在實際應用上也顯現出幾項限制。例如,有時未能完整掌握報告的上下文,導致評語與內容略有出入;或過度聚焦於改進建議,欠缺足夠的鼓勵性語句。這些問題說明ChatGPT在理解語境與情感面表達上仍須人類協助與補充。

四、AI融入領導力評量的未來?

  本研究雖顯示AI具備穩定評分與結構化回饋的能力,但實際應用中,師傅校長也表達了許多顧慮。他們認為AI評語語氣過於制式,可能會被學員察覺不是出自師傅之手,進而影響彼此信任與師徒互動。因此,未來應強化AI與人評的「混合式運用模式」,例如讓AI先提供回饋草稿,再由導師根據對學員的了解做補充與個人化修訂。這樣既可節省時間,又保有導師的專業判斷與情感關懷,提升回饋的真實性與教育意涵。

  師傅校長亦反映,雖然AI語句清楚有條理,但缺乏情感溫度與鼓勵語氣,容易讓學員感到距離感。建議可進一步設計讓AI加入更多正向引導與肯定的語句風格,使回饋更具激勵性與人性。

 

資料來源

謝名娟(2025)。AI也能當校長?ChatGPT在校長領導人才評量之應用(計畫編號:113-2410-H-656-001-MY2)(連結網址一連結網址二)。國科會計畫期中報告。


附加檔案

  1. PDF檔案 生成式人工智慧在領導評量之應用.pdf (另開新視窗)

校長領導評量 (另開新視窗) 生成式AI (另開新視窗) 人機協作評分 (另開新視窗)
:::