公式資料確認資料確認:2026年10月3日。評価セット・指標・採用条件は編集上の提案です。モデル比較や品質・時間・費用の実測は未実施です。

プロンプトを直して1件うまくいっても、別の質問が悪くなることがあります。この記事では、同じ課題と判定条件で変更前後を比べ、品質・人の確認時間・費用を一緒に見る評価表を作ります。

公式資料から分かること:用途に応じた信頼性の評価

NISTのAI RMFは、AIの設計・開発・利用・評価へ信頼性の観点を取り込む自主的な枠組みです。本稿の評価表は運用上の提案で、NISTの認定や共通の合格点ではありません。草案作成と自動送信では、許容する誤りや確認手順が異なります。

仕事の具体例:社内FAQを改善する

架空の社内FAQなら、通常の質問、例外条件、資料に答えがない質問、権限のない資料を求める質問を含めます。10問から始める案ですが、10問で全体の品質を保証できるわけではありません。

  • 通常例:必要な条件と根拠を示せるか。
  • 例外例:対象者や適用時期を省略しないか。
  • 根拠不足:推測で埋めず、不足や確認先を示せるか。
  • 権限違い:取得資料・回答・引用が許可された範囲内か。

各問に期待内容、禁止内容、根拠の版、重大な誤りの条件を付けます。開発で何度も見るセットと、最後に使う別の確認セットを分けると、見慣れた問題だけに合わせた改善を点検できます。

コピーして使える比較記録

用途/責任者/評価セットの版:
比較案A・B:モデル・プロンプト・検索設定・資料の版
実行日/同じにする条件/繰り返す回数:
問ID | 種類 | 期待内容・根拠 | 禁止内容・重大な誤り
 |  |  |
問ID | 案 | 出力・取得資料 | 判定理由 | 処理秒 | 確認・修正分 | 費用
 |  |  |  |  |  |
成功の定義/成功件数:
重大な誤りの件数・内容:
総費用÷成功した業務件数(成功0件なら算出不可):
未確認事項/採用・保留・不採用と理由:

結果の確認ポイント

  1. 品質:問ごとの条件と根拠で判定する。平均点だけで情報漏えいなどの重大な誤りを隠さない。
  2. 時間:処理時間と人の確認・修正時間を分ける。失敗や保留も除外しない。
  3. 費用:検索・連携・再試行などを含む範囲を明記する。不明な費用をゼロとしない。

出力には揺れがあるので、1回で必ず改善したとは断定しません。繰り返し回数を記録し、結果を見た後で基準を都合よく変えないでください。評価セットを更新するなら版を分け、同じ版で両案を再評価します。

評価には許可されたデータや架空データを使い、比較のために機密情報を別サービスへ移しません。正解が曖昧なら業務責任者と判定基準を確認します。

今日試すこと

代表的な質問と難しい質問を含む小さなセットを作り、期待内容と重大な誤りの条件を埋めてください。採用条件を先に決めると、速さや安さだけに引っ張られず判断できます。

参考資料

記事一覧へ戻る