評分標準 Rubric
共用與內嵌兩種形態、分析式與整體式兩種評分法,以及級距的驗證規則
評分標準(Rubric)是 AI 批閱與評分方式的定義物件。此些標準可以建立為多題目共用的獨立物件,也可以內嵌在單一題目中。
- 獨立的評分標準物件(
rub_前綴,版本化)是共用且可在不同題目之間重複使用的標準,在題目中使用scoring.rubric_ref引用。同一題型的題目(例如:所有學測英文作文)便可以使用同一套標準進行批閱。 - 內嵌標準將直接定義在個別題目的
scoring.rubric中。該些標準將依附於題目而存在,並且隨題目一起版本化。內嵌標準不會建立一筆獨立的評分標準物件,因此無法透過GET /rubrics查詢,也不能獨立封存。
若評分標準將有跨題目共用的需求,則建議採獨立物件形態建立。標準若確實專屬於單一題目,則採內嵌。
引用獨立標準時,標準內容將整套採用的,不能針對單一題目修改或複寫。
若要為特定題目補充要求,請使用該題目中的 scoring.reference_answer欄位,作為「正確/參考答案」的補充說明。
若上述參考答案的補充仍然不足,並需要不同的評分方式或構成,便應改用內嵌標準。
內建預設評分標準
為提供簡便的題目上架與設定流程,本服務已內建數個台灣高中情境中,經常使用的題型對應評分標準,在上架題目時,建議盡量直接取用。
此些標準由 Tera Thinker 維護,您可以引用,並在引用的題目中標記獨立的 reference_answer,但無法直接編輯此些評分標準物件本身。在 API 中,內建標準的 owner 欄位為 "platform"(貴組織自建的標準則為 "organization"),列出評分標準時可用 ?owner= 篩選兩者;對內建標準送出修改、封存或取消封存,會收到 403 ERR_FORBIDDEN(details.reason: "platform_managed");需要不同內容時,請內嵌自己的 scoring.rubric 或另建組織自有的標準。
此些評分標準亦遵循同樣的版本化機制,我們會持續更新,並推出使評分更加精進的新版本。不同版本或評分標準之間,可能適用的年度範圍、科目、題型亦可能存在差異,引用時請詳加留意。
| 考試 | 科目 | 題型 | 評分標準版本參照 | 備註 |
|---|---|---|---|---|
| 高中學測 | 國寫 | 第一大題(知性題)第一小題 | rub_gsat111-chi-composition-intel-sub1:1 | 111 學年度起適用 |
| 第一大題(知性題)第二小題 | rub_gsat111-chi-composition-intel-sub2:1 | 111 學年度起適用 | ||
| 第二大題(情意題) | rub_gsat111-chi-composition-emo:1 | 111 學年度起適用 | ||
| 國綜 | 混合題 所有非選擇題通用 | rub_gsat111-chi-nmc:1 | 111 學年度起適用 | |
| 英文 | 非選擇題 中譯英 | rub_gsat111-eng-trans:1 | 111 學年度起適用 |
本服務上線初期,評分標準的建構尚在完善中。請在建立題目時,盡量引用預先建立的評分標準,以便後續維護與更新。
評分標準的結構種類
本服務可設定並支援常見的整體式評分(Holistic Scoring)與分析式評分(Analytic Scoring)方法。每一題目分別只能使用一種評分法。
兩種評分法在評分標準物件中,分別使用不同的欄位指定其細節。同時提供或都不提供皆會被拒絕請求。
| 評分法 | 評分標準中的欄位 | 底下的分項稱為 | 批閱結果中的欄位 |
|---|---|---|---|
| 分析式評分 Analytic | dimensions | 向度 Dimension | dimensions[] |
| 整體式評分 Holistic | criteria | 準則 Criterion | criteria[] |
只有一個評量向度的題目怎麼寫?
一道填空或簡答題,若只需要「全對/部分對/錯」這樣一個整體判斷,
請寫成只有一個向度的 dimensions,而不是 criteria。
請以「該題的總分是否由底下的分項加總而來」決定是否採用整體式評分。
只有一個向度時,總分仍然是由該向度加總而得。criteria 僅適用於總分不由分項加總、
而是由本服務的計分程式產生的題型。詳見以下兩個種類的分別說明。
分析式評分 Analytic Scoring
典型範例為高中學測英文作文。每份作答批閱時,將拆解為四個獨立的向度(Dimension),例如「內容」、「組織」、「文法」、「字彙」。每個向度分別給定分數,並將四個向度分數加總作為該作答的得分。
以下為一組最小的完整範例,或見本頁面的另外一則範例。
{
"name": "簡答題內容與組織雙向度標準",
"dimensions": [
{
"name": "內容",
"description": "論點的正確性與充分性。",
"levels": [
{ "score": 6, "description": "論點正確且充分展開。" },
{ "score": 3, "description": "論點正確但展開不足。" },
{ "score": 0, "description": "論點錯誤或未作答。" }
]
},
{
"name": "組織",
"description": "段落安排與論證順序。",
"levels": [
{ "score": 4, "description": "結構清晰,層次分明。" },
{ "score": 2, "description": "結構大致完整。" },
{ "score": 0, "description": "結構凌亂。" }
]
}
]
}向度量尺級距 Dimension
分析式評分的每個向度,需要設定多個評分級距(Level)。級距可以使用 絕對分數表示 或 比例表示,來表達一個級距的分數價值,兩者擇一。同一套分析式評分標準內的所有級距,必須使用同一種表示法。
- 絕對分數表示:直接給定「評分的分數值」。因此一組標準將只能服務配分相同的題目。
- 比例表示:各級距僅標示「在該向度中的相對得分比例」,最終得分將以比例乘以該向度的滿分,因此同一套標準可服務任何
max_score的題目。每個評分向度另外需要給定weight參數,表示該向度將佔該題目配分的比例。所有向度的weight加總必須為1.0。
| 絕對分數表示 | 比例表示 | |
|---|---|---|
| 級距的給定數值用的參數名稱 | score | ratio |
| 級距的數值範圍 | 0~任意 | 0.0~1.0,有效至小數點第二位 |
每個向度需要給定 weight | 否 | 是 |
| 一個向度的滿分 | 該向度最高級距的 score | weight 乘以題目的 max_score |
| 向度得分的計算 | 不需計算,直接採用命中級距的 score | ratio 乘以該向度的滿分,四捨五入至小數第二位 |
一個題目的總分 max_score | 題目仍必須設定,且必須等於各向度滿分的加總,否則回應 400 | 以題目設定的 max_score 為準,評分標準不加以限制 |
使用比例表示時,每個向度的 weight 加總必須等於 1.00。即使只有一個向度,weight 仍為必填(此時必然是 1.00)。
比例標準在任意向度數下,能跨不同配分的題目共用。
舉例來說,一組擁有三個向度的標準,且權重為 0.5 / 0.3 / 0.2,
在 20 分的題目上產生 10 / 6 / 4 的向度滿分,在 10 分的題目上則是 5 / 3 / 2。
因此,若同題型的題目之間若可能有不同的配分,請使用比例表示法,或直接改用各題目獨立的內嵌標準。
整體式評分 Holistic Scoring
典型範例為高中學測國寫。批閱一份作答時,將綜合考量所有評量層面,並直接給出一個單獨總分。縱然批閱的最終結果或評語中,可能會包含拆解的說明,評析不同能力的表現。但該些拆解說明(及其分數或等第),不能單純的「加總」來形成總分。
以下為一組最小的完整範例,或見本頁面的另外一則範例。
{
"name": "國文作文立意與結構標準",
"criteria": [
{
"name": "立意取材",
"description": "審題立意與取材切題的一般標準。",
"levels": [
{ "ratio": 1.0, "description": "立意深刻、取材切題。" },
{ "ratio": 0.5, "description": "立意尚可、取材普通。" },
{ "ratio": 0.0, "description": "離題或空泛。" }
]
},
{
"name": "結構",
"description": "段落組織與行文脈絡。",
"levels": [
{ "ratio": 1.0, "description": "結構嚴謹、脈絡清晰。" },
{ "ratio": 0.5, "description": "結構大致完整。" },
{ "ratio": 0.0, "description": "結構凌亂。" }
]
}
]
}歸因量尺級距 Criterion
整體式評分的評分標準,同樣需要提供級距。但此些級距僅提供評分程式瞭解,並設定進行整體式評分時所需要考慮的各項準則,以及在直接形成總分後,對該總分的形成進行歸因解釋的參考對照。
歸因量尺級距的寫法與比例表示法的向度量尺級距相同,但有兩點不同:
- 只能使用
ratio,不接受score。 - 不接受
weight。 準則不佔總分的任何份額,因此也沒有滿分可以推導。
批閱結果中,每個準則回報的是它命中級距的 ratio,欄位名稱為 level 而非 score,且不帶 max。
分析式與整體式評分的比較
| 分析式評分 Analytic | 整體式評分 Holistic | |
|---|---|---|
| 評分標準中的欄位 | dimensions | criteria |
| 底下分項的作用 | 拆解得分加總的構成 | 解釋單一得分的歸因 |
| 與總分的關係 | 各部分構成總分 | 各部分描述作答,與總分無算術關係 |
| 總分怎麼產生 | 各向度得分加總 | 由平台端的計分程式產生 |
| 總分的計算等式 | Σ earned = score.earned,無條件成立 | 無,且不隱含任何等式,因為分項本身不計分 |
| 級距的表示法 | score 或 ratio,二擇一 | 只能用 ratio |
weight | 使用 ratio 時必填,使用 score 時不接受 | 不接受 |
| 批閱結果上 | dimensions[],每筆帶 score: {earned, max} | criteria[],每筆帶 level,且沒有 max |
| 讀者得到的資訊 | 分數是怎麼組成的,並且可以自行驗算 | 作答在各軸落在哪一級,以及是哪一軸拉抬或拖累了總分 |
| 典型用途 | 學測英文作文,四向度 × 5 分 = 20 分 | 學測國寫,總分由計分程式產生 |
驗證規則
以下規則在建立與更新時都會強制執行,違反時將回應 400 ERR_VALIDATION_FAILED 錯誤。
- 一組評分標準中,
dimensions與criteria兩種設定方式必須二擇一。 - 一組
dimensions標準中,級距的表示法score與ratio必須二擇一。且該評分標準中的所有級距,表示法都必須統一。 - 一組
criteria標準中,級距只能使用ratio,不接受score。 - 若採用
ratio給定向度的級距配分,則該向度必須填寫weight,且所有向度的Σ weight必須等於1.00。(使用score時,或評分標準為criteria則不接受)。 - 若採用
score給定向度的級距配分,則各向度最高級距分數的加總,必須等於引用此標準的題目所設定的max_score。 - 級距的數值
score與ratio最多兩位小數。 - 各個 Dimension(或 Criterion)的名稱,在同一組標準內必須唯一。
- 級距數值在其所屬的 Dimension(或 Criterion)中必須唯一。
- 每一組級距都要有零分級距(見下)。
每套標準都要有零分級距
每一組向度評分(或歸因量尺)級距中,都必須包含一個得分(或比例)為 0 的級距。缺少時將會被拒絕請求。
當學生作答空白、完全錯誤、離題,或內容涉及違反本服務使用及處理規範的敏感內容時,評分都將是 0 分。
級距數值在同一組內必須唯一
同一組級距內,不得有兩個級距共用同一個 score(或 ratio)。
當可能存在多組標準都會被評分為同一級距時,應將所有相符的標準描述寫成同一個級距。描述中列出各種情形,並說明符合任一即得該分。例如:
{
"score": 4,
"description": "符合下列任一情形即得 4 分:(一)列出兩點,描述大致正確;(二)僅列出一點,但有正確舉例佐證。"
}級距數值最多兩位小數。
版本與封存
獨立評分標準物件
獨立評分標準物件的版本規則,與題目的運作方式完全一致。POST 建立 version 1,每次 PATCH 產生新的不可變版本。使用版本化參照 rub_abc:2 以讀取確切版本。
題目的 scoring.rubric_ref 在題目寫入時即解析為明確版本,因此發布 rub_fhz:2 不會影響任何已使用在 rub_fhz:1 的題目,只有之後寫入的題目才能採用新版本。
封存時,評分標準物件將無法從預設列表中讀取、且不能再被新題目採用。但每個已引用的題目均照常解析,其批閱效果與結果不變。已封存的評分標準不能更新,PATCH 將會回應 409 錯誤。已封存的評分標準可解除封存。
內嵌於題目中的評分標準
題目的內嵌標準沒有獨立的 status,它們屬於題目的一部分,並隨題目一起封存/取消封存。
範例
此些範例僅示範評分標準的定義方式。示範內容本身可能與本服務所提供的內建評分標準相似或重疊。若有類似的評分需求,請先參考內建的評分標準,避免重複建立。
通用簡答標準:一個向度,任何滿分皆可共用
比例級距的全/半/零,2 分的題目與 10 分的題目可以共用同一套。在 6 分的題目上命中中間級距即得 0.5 × 1.0 × 6 = 3 分,該向度的滿分為 6。
{
"name": "簡答題全/半/零通用標準",
"dimensions": [
{
"name": "整體",
"weight": 1.0,
"levels": [
{ "ratio": 1.0, "description": "完整答出題目要求的所有要點。" },
{ "ratio": 0.5, "description": "答出部分要點,或要點正確但不完整。" },
{ "ratio": 0.0, "description": "答案錯誤、離題或空白。" }
]
}
]
}共用的申論標準:三個向度,同樣不釘滿分
同一套標準在 20 分的題目上產生 10 / 6 / 4 的向度滿分,在 10 分的題目上則是 5 / 3 / 2。
{
"name": "通用申論三向度標準",
"dimensions": [
{
"name": "內容",
"description": "論點的正確性與充分性。",
"weight": 0.5,
"levels": [
{ "ratio": 1.0, "description": "論點正確且充分展開。" },
{ "ratio": 0.6, "description": "論點正確但展開不足。" },
{ "ratio": 0.0, "description": "論點錯誤或未作答。" }
]
},
{
"name": "組織",
"description": "段落安排與論證順序。",
"weight": 0.3,
"levels": [
{ "ratio": 1.0, "description": "結構清晰,層次分明。" },
{ "ratio": 0.5, "description": "結構大致完整。" },
{ "ratio": 0.0, "description": "結構凌亂。" }
]
},
{
"name": "文辭",
"description": "用詞準確度與表達流暢度。",
"weight": 0.2,
"levels": [
{ "ratio": 1.0, "description": "用詞精確,表達流暢。" },
{ "ratio": 0.5, "description": "尚稱通順。" },
{ "ratio": 0.0, "description": "語病嚴重,妨礙理解。" }
]
}
]
}英文作文:絕對級距,4 × 5 = 20
不帶 weight:級距數值本身已表明各向度的佔比,且其加總必須等於題目的 max_score。
{
"name": "English Composition Rubric",
"dimensions": [
{
"name": "Grammar",
"description": "Grammatical range and accuracy.",
"levels": [
{ "score": 5, "description": "Virtually error-free." },
{ "score": 3, "description": "Occasional errors; meaning clear." },
{ "score": 1, "description": "Frequent errors impede meaning." },
{ "score": 0, "description": "No credit." }
]
},
{
"name": "Content",
"description": "Relevance and development of ideas.",
"levels": [
{ "score": 5, "description": "Fully addresses the prompt." },
{ "score": 3, "description": "Adequately developed." },
{ "score": 1, "description": "Minimal or off-topic." },
{ "score": 0, "description": "No credit." }
]
},
{
"name": "Structure",
"description": "Organization and cohesion.",
"levels": [
{ "score": 5, "description": "Clear, cohesive organization." },
{ "score": 3, "description": "Generally organized." },
{ "score": 1, "description": "Poorly organized." },
{ "score": 0, "description": "No credit." }
]
},
{
"name": "Vocabulary",
"description": "Range and precision of word choice.",
"levels": [
{ "score": 5, "description": "Wide and precise." },
{ "score": 3, "description": "Adequate range." },
{ "score": 1, "description": "Limited or inaccurate." },
{ "score": 0, "description": "No credit." }
]
}
]
}國文作文:用準則,不用向度
總分由計分程式產生,因此這些軸是在描述作答,而非構成分數。它們採 ratio 級距、不帶 weight,批閱結果會以 criteria 回報,且不帶 max。
{
"name": "國中國文作文評分標準",
"criteria": [
{
"name": "立意取材",
"description": "審題立意與取材切題的一般標準。",
"levels": [
{ "ratio": 1.0, "description": "立意深刻、取材切題。" },
{ "ratio": 0.5, "description": "立意尚可、取材普通。" },
{ "ratio": 0.0, "description": "離題或空泛。" }
]
},
{
"name": "結構",
"description": "段落組織與行文脈絡。",
"levels": [
{ "ratio": 1.0, "description": "結構嚴謹、脈絡清晰。" },
{ "ratio": 0.5, "description": "結構大致完整。" },
{ "ratio": 0.0, "description": "結構凌亂。" }
]
},
{
"name": "文采",
"description": "遣詞造句與修辭表達。",
"levels": [
{ "ratio": 1.0, "description": "文辭優美、修辭得宜。" },
{ "ratio": 0.5, "description": "文辭通順。" },
{ "ratio": 0.0, "description": "語病嚴重。" }
]
}
]
}相關
- API 參考 — 評分標準
- 題目 —
rubric_ref與rubric二選一 - 取得批閱結果 — 標準的結構如何決定結果的形狀