龍騰 AI 非選批閱平台 開發者文件中心
建置題庫與考試

評分標準 Rubric

共用與內嵌兩種形態、分析式與整體式兩種評分法,以及級距的驗證規則

評分標準(Rubric)是 AI 批閱與評分方式的定義物件。此些標準可以建立為多題目共用的獨立物件,也可以內嵌在單一題目中。

  • 獨立的評分標準物件(rub_ 前綴,版本化)是共用且可在不同題目之間重複使用的標準,在題目中使用 scoring.rubric_ref 引用。同一題型的題目(例如:所有學測英文作文)便可以使用同一套標準進行批閱。
  • 內嵌標準將直接定義在個別題目的 scoring.rubric 中。該些標準將依附於題目而存在,並且隨題目一起版本化。內嵌標準不會建立一筆獨立的評分標準物件,因此無法透過 GET /rubrics 查詢,也不能獨立封存。

若評分標準將有跨題目共用的需求,則建議採獨立物件形態建立。標準若確實專屬於單一題目,則採內嵌。

引用獨立標準時,標準內容將整套採用的,不能針對單一題目修改或複寫。

若要為特定題目補充要求,請使用該題目中的 scoring.reference_answer欄位,作為「正確/參考答案」的補充說明。 若上述參考答案的補充仍然不足,並需要不同的評分方式或構成,便應改用內嵌標準。

內建預設評分標準

為提供簡便的題目上架與設定流程,本服務已內建數個台灣高中情境中,經常使用的題型對應評分標準,在上架題目時,建議盡量直接取用。

此些標準由 Tera Thinker 維護,您可以引用,並在引用的題目中標記獨立的 reference_answer,但無法直接編輯此些評分標準物件本身。在 API 中,內建標準的 owner 欄位為 "platform"(貴組織自建的標準則為 "organization"),列出評分標準時可用 ?owner= 篩選兩者;對內建標準送出修改、封存或取消封存,會收到 403 ERR_FORBIDDENdetails.reason: "platform_managed");需要不同內容時,請內嵌自己的 scoring.rubric 或另建組織自有的標準。

此些評分標準亦遵循同樣的版本化機制,我們會持續更新,並推出使評分更加精進的新版本。不同版本或評分標準之間,可能適用的年度範圍、科目、題型亦可能存在差異,引用時請詳加留意。

考試科目題型評分標準版本參照備註
高中學測國寫第一大題(知性題)第一小題rub_gsat111-chi-composition-intel-sub1:1111 學年度起適用
第一大題(知性題)第二小題rub_gsat111-chi-composition-intel-sub2:1111 學年度起適用
第二大題(情意題)rub_gsat111-chi-composition-emo:1111 學年度起適用
國綜混合題 所有非選擇題通用rub_gsat111-chi-nmc:1111 學年度起適用
英文非選擇題 中譯英rub_gsat111-eng-trans:1111 學年度起適用

本服務上線初期,評分標準的建構尚在完善中。請在建立題目時,盡量引用預先建立的評分標準,以便後續維護與更新。

評分標準的結構種類

本服務可設定並支援常見的整體式評分(Holistic Scoring)與分析式評分(Analytic Scoring)方法。每一題目分別只能使用一種評分法。

兩種評分法在評分標準物件中,分別使用不同的欄位指定其細節。同時提供或都不提供皆會被拒絕請求。

評分法評分標準中的欄位底下的分項稱為批閱結果中的欄位
分析式評分 Analyticdimensions向度 Dimensiondimensions[]
整體式評分 Holisticcriteria準則 Criterioncriteria[]

只有一個評量向度的題目怎麼寫?

一道填空或簡答題,若只需要「全對/部分對/錯」這樣一個整體判斷, 請寫成只有一個向度的 dimensions,而不是 criteria

請以「該題的總分是否由底下的分項加總而來」決定是否採用整體式評分。 只有一個向度時,總分仍然是由該向度加總而得。criteria 僅適用於總分不由分項加總、 而是由本服務的計分程式產生的題型。詳見以下兩個種類的分別說明。

分析式評分 Analytic Scoring

典型範例為高中學測英文作文。每份作答批閱時,將拆解為四個獨立的向度(Dimension),例如「內容」、「組織」、「文法」、「字彙」。每個向度分別給定分數,並將四個向度分數加總作為該作答的得分。

以下為一組最小的完整範例,或見本頁面的另外一則範例

{
  "name": "簡答題內容與組織雙向度標準",
  "dimensions": [
    {
      "name": "內容",
      "description": "論點的正確性與充分性。",
      "levels": [
        { "score": 6, "description": "論點正確且充分展開。" },
        { "score": 3, "description": "論點正確但展開不足。" },
        { "score": 0, "description": "論點錯誤或未作答。" }
      ]
    },
    {
      "name": "組織",
      "description": "段落安排與論證順序。",
      "levels": [
        { "score": 4, "description": "結構清晰,層次分明。" },
        { "score": 2, "description": "結構大致完整。" },
        { "score": 0, "description": "結構凌亂。" }
      ]
    }
  ]
}

向度量尺級距 Dimension

分析式評分的每個向度,需要設定多個評分級距(Level)。級距可以使用 絕對分數表示比例表示,來表達一個級距的分數價值,兩者擇一。同一套分析式評分標準內的所有級距,必須使用同一種表示法。

  • 絕對分數表示:直接給定「評分的分數值」。因此一組標準將只能服務配分相同的題目。
  • 比例表示:各級距僅標示「在該向度中的相對得分比例」,最終得分將以比例乘以該向度的滿分,因此同一套標準可服務任何 max_score 的題目。每個評分向度另外需要給定 weight 參數,表示該向度將佔該題目配分的比例。所有向度的 weight 加總必須為 1.0
絕對分數表示比例表示
級距的給定數值用的參數名稱scoreratio
級距的數值範圍0~任意0.0~1.0,有效至小數點第二位
每個向度需要給定 weight
一個向度的滿分該向度最高級距的 scoreweight 乘以題目的 max_score
向度得分的計算不需計算,直接採用命中級距的 scoreratio 乘以該向度的滿分,四捨五入至小數第二位
一個題目的總分 max_score題目仍必須設定,且必須等於各向度滿分的加總,否則回應 400以題目設定的 max_score 為準,評分標準不加以限制

使用比例表示時,每個向度的 weight 加總必須等於 1.00。即使只有一個向度,weight 仍為必填(此時必然是 1.00)。

比例標準在任意向度數下,能跨不同配分的題目共用。

舉例來說,一組擁有三個向度的標準,且權重為 0.5 / 0.3 / 0.2, 在 20 分的題目上產生 10 / 6 / 4 的向度滿分,在 10 分的題目上則是 5 / 3 / 2。 因此,若同題型的題目之間若可能有不同的配分,請使用比例表示法,或直接改用各題目獨立的內嵌標準。

整體式評分 Holistic Scoring

典型範例為高中學測國寫。批閱一份作答時,將綜合考量所有評量層面,並直接給出一個單獨總分。縱然批閱的最終結果或評語中,可能會包含拆解的說明,評析不同能力的表現。但該些拆解說明(及其分數或等第),不能單純的「加總」來形成總分。

以下為一組最小的完整範例,或見本頁面的另外一則範例

{
  "name": "國文作文立意與結構標準",
  "criteria": [
    {
      "name": "立意取材",
      "description": "審題立意與取材切題的一般標準。",
      "levels": [
        { "ratio": 1.0, "description": "立意深刻、取材切題。" },
        { "ratio": 0.5, "description": "立意尚可、取材普通。" },
        { "ratio": 0.0, "description": "離題或空泛。" }
      ]
    },
    {
      "name": "結構",
      "description": "段落組織與行文脈絡。",
      "levels": [
        { "ratio": 1.0, "description": "結構嚴謹、脈絡清晰。" },
        { "ratio": 0.5, "description": "結構大致完整。" },
        { "ratio": 0.0, "description": "結構凌亂。" }
      ]
    }
  ]
}

歸因量尺級距 Criterion

整體式評分的評分標準,同樣需要提供級距。但此些級距僅提供評分程式瞭解,並設定進行整體式評分時所需要考慮的各項準則,以及在直接形成總分後,對該總分的形成進行歸因解釋的參考對照。

歸因量尺級距的寫法與比例表示法的向度量尺級距相同,但有兩點不同:

  • 只能使用 ratio,不接受 score
  • 不接受 weight 準則不佔總分的任何份額,因此也沒有滿分可以推導。

批閱結果中,每個準則回報的是它命中級距的 ratio,欄位名稱為 level 而非 score,且不帶 max

分析式與整體式評分的比較

分析式評分 Analytic整體式評分 Holistic
評分標準中的欄位dimensionscriteria
底下分項的作用拆解得分加總的構成解釋單一得分的歸因
與總分的關係各部分構成總分各部分描述作答,與總分無算術關係
總分怎麼產生各向度得分加總由平台端的計分程式產生
總分的計算等式Σ earned = score.earned無條件成立無,且不隱含任何等式,因為分項本身不計分
級距的表示法scoreratio,二擇一只能用 ratio
weight使用 ratio 時必填,使用 score 時不接受不接受
批閱結果上dimensions[],每筆帶 score: {earned, max}criteria[],每筆帶 level,且沒有 max
讀者得到的資訊分數是怎麼組成的,並且可以自行驗算作答在各軸落在哪一級,以及是哪一軸拉抬或拖累了總分
典型用途學測英文作文,四向度 × 5 分 = 20 分學測國寫,總分由計分程式產生

驗證規則

以下規則在建立與更新時都會強制執行,違反時將回應 400 ERR_VALIDATION_FAILED 錯誤。

  1. 一組評分標準中,dimensionscriteria 兩種設定方式必須二擇一。
  2. 一組 dimensions 標準中,級距的表示法 scoreratio 必須二擇一。且該評分標準中的所有級距,表示法都必須統一。
  3. 一組 criteria 標準中,級距只能使用 ratio,不接受 score
  4. 若採用 ratio 給定向度的級距配分,則該向度必須填寫 weight,且所有向度的 Σ weight 必須等於 1.00。(使用 score 時,或評分標準為 criteria 則不接受)。
  5. 若採用 score 給定向度的級距配分,則各向度最高級距分數的加總,必須等於引用此標準的題目所設定的 max_score
  6. 級距的數值 scoreratio 最多兩位小數。
  7. 各個 Dimension(或 Criterion)的名稱,在同一組標準內必須唯一。
  8. 級距數值在其所屬的 Dimension(或 Criterion)中必須唯一。
  9. 每一組級距都要有零分級距(見下)。

每套標準都要有零分級距

每一組向度評分(或歸因量尺)級距中,都必須包含一個得分(或比例)為 0 的級距。缺少時將會被拒絕請求。

當學生作答空白、完全錯誤、離題,或內容涉及違反本服務使用及處理規範的敏感內容時,評分都將是 0 分。

級距數值在同一組內必須唯一

同一組級距內,不得有兩個級距共用同一個 score(或 ratio)。

當可能存在多組標準都會被評分為同一級距時,應將所有相符的標準描述寫成同一個級距。描述中列出各種情形,並說明符合任一即得該分。例如:

{
  "score": 4,
  "description": "符合下列任一情形即得 4 分:(一)列出兩點,描述大致正確;(二)僅列出一點,但有正確舉例佐證。"
}

級距數值最多兩位小數。

版本與封存

獨立評分標準物件

獨立評分標準物件的版本規則,與題目的運作方式完全一致。POST 建立 version 1,每次 PATCH 產生新的不可變版本。使用版本化參照 rub_abc:2 以讀取確切版本。

題目的 scoring.rubric_ref 在題目寫入時即解析為明確版本,因此發布 rub_fhz:2 不會影響任何已使用在 rub_fhz:1 的題目,只有之後寫入的題目才能採用新版本。

封存時,評分標準物件將無法從預設列表中讀取、且不能再被新題目採用。但每個已引用的題目均照常解析,其批閱效果與結果不變。已封存的評分標準不能更新,PATCH 將會回應 409 錯誤。已封存的評分標準可解除封存。

內嵌於題目中的評分標準

題目的內嵌標準沒有獨立的 status,它們屬於題目的一部分,並隨題目一起封存/取消封存。

範例

此些範例僅示範評分標準的定義方式。示範內容本身可能與本服務所提供的內建評分標準相似或重疊。若有類似的評分需求,請先參考內建的評分標準,避免重複建立。

通用簡答標準:一個向度,任何滿分皆可共用

比例級距的全/半/零,2 分的題目與 10 分的題目可以共用同一套。在 6 分的題目上命中中間級距即得 0.5 × 1.0 × 6 = 3 分,該向度的滿分為 6

{
  "name": "簡答題全/半/零通用標準",
  "dimensions": [
    {
      "name": "整體",
      "weight": 1.0,
      "levels": [
        { "ratio": 1.0, "description": "完整答出題目要求的所有要點。" },
        { "ratio": 0.5, "description": "答出部分要點,或要點正確但不完整。" },
        { "ratio": 0.0, "description": "答案錯誤、離題或空白。" }
      ]
    }
  ]
}

共用的申論標準:三個向度,同樣不釘滿分

同一套標準在 20 分的題目上產生 10 / 6 / 4 的向度滿分,在 10 分的題目上則是 5 / 3 / 2

{
  "name": "通用申論三向度標準",
  "dimensions": [
    {
      "name": "內容",
      "description": "論點的正確性與充分性。",
      "weight": 0.5,
      "levels": [
        { "ratio": 1.0, "description": "論點正確且充分展開。" },
        { "ratio": 0.6, "description": "論點正確但展開不足。" },
        { "ratio": 0.0, "description": "論點錯誤或未作答。" }
      ]
    },
    {
      "name": "組織",
      "description": "段落安排與論證順序。",
      "weight": 0.3,
      "levels": [
        { "ratio": 1.0, "description": "結構清晰,層次分明。" },
        { "ratio": 0.5, "description": "結構大致完整。" },
        { "ratio": 0.0, "description": "結構凌亂。" }
      ]
    },
    {
      "name": "文辭",
      "description": "用詞準確度與表達流暢度。",
      "weight": 0.2,
      "levels": [
        { "ratio": 1.0, "description": "用詞精確,表達流暢。" },
        { "ratio": 0.5, "description": "尚稱通順。" },
        { "ratio": 0.0, "description": "語病嚴重,妨礙理解。" }
      ]
    }
  ]
}

英文作文:絕對級距,4 × 5 = 20

不帶 weight:級距數值本身已表明各向度的佔比,且其加總必須等於題目的 max_score

{
  "name": "English Composition Rubric",
  "dimensions": [
    {
      "name": "Grammar",
      "description": "Grammatical range and accuracy.",
      "levels": [
        { "score": 5, "description": "Virtually error-free." },
        { "score": 3, "description": "Occasional errors; meaning clear." },
        { "score": 1, "description": "Frequent errors impede meaning." },
        { "score": 0, "description": "No credit." }
      ]
    },
    {
      "name": "Content",
      "description": "Relevance and development of ideas.",
      "levels": [
        { "score": 5, "description": "Fully addresses the prompt." },
        { "score": 3, "description": "Adequately developed." },
        { "score": 1, "description": "Minimal or off-topic." },
        { "score": 0, "description": "No credit." }
      ]
    },
    {
      "name": "Structure",
      "description": "Organization and cohesion.",
      "levels": [
        { "score": 5, "description": "Clear, cohesive organization." },
        { "score": 3, "description": "Generally organized." },
        { "score": 1, "description": "Poorly organized." },
        { "score": 0, "description": "No credit." }
      ]
    },
    {
      "name": "Vocabulary",
      "description": "Range and precision of word choice.",
      "levels": [
        { "score": 5, "description": "Wide and precise." },
        { "score": 3, "description": "Adequate range." },
        { "score": 1, "description": "Limited or inaccurate." },
        { "score": 0, "description": "No credit." }
      ]
    }
  ]
}

國文作文:用準則,不用向度

總分由計分程式產生,因此這些軸是在描述作答,而非構成分數。它們採 ratio 級距、不帶 weight,批閱結果會以 criteria 回報,且不帶 max

{
  "name": "國中國文作文評分標準",
  "criteria": [
    {
      "name": "立意取材",
      "description": "審題立意與取材切題的一般標準。",
      "levels": [
        { "ratio": 1.0, "description": "立意深刻、取材切題。" },
        { "ratio": 0.5, "description": "立意尚可、取材普通。" },
        { "ratio": 0.0, "description": "離題或空泛。" }
      ]
    },
    {
      "name": "結構",
      "description": "段落組織與行文脈絡。",
      "levels": [
        { "ratio": 1.0, "description": "結構嚴謹、脈絡清晰。" },
        { "ratio": 0.5, "description": "結構大致完整。" },
        { "ratio": 0.0, "description": "結構凌亂。" }
      ]
    },
    {
      "name": "文采",
      "description": "遣詞造句與修辭表達。",
      "levels": [
        { "ratio": 1.0, "description": "文辭優美、修辭得宜。" },
        { "ratio": 0.5, "description": "文辭通順。" },
        { "ratio": 0.0, "description": "語病嚴重。" }
      ]
    }
  ]
}

相關

本頁內容