Kyalulu/docs
GitHub EN
ガイド一覧⌄

開発・評価する

CharacterBenchで何を測れるか

12キャラ・264応答の固定パイロットで、機械採点とキャラ品質を分けて比較する。

このガイドの要点

  • CharacterBenchは日本語Character AIを評価する独立したMITライセンスのパイロットです。
  • 12キャラ、120単発問題、12本の12ターン対話で、モデル・反復ごとに264応答を生成します。
  • 構造化状態や表面条件の点数を、キャラクター品質の総合点や検証済みランキングとして扱いません。
このページの内容
  1. このガイドの要点
  2. 本体ベンチとは別の評価系
  3. 推論なしで構成を確認する
  4. 機械採点とキャラ品質を分ける
  5. 実モデルを比べる前の確認

本体ベンチとは別の評価系#

CharacterBench v0.1は、日本語キャラクターAIを比較する独立したMITライセンスの工学パイロットです。12人のオリジナル成人架空キャラ、120単発プローブと12本の12ターン対話から、モデルごと・1反復あたり264応答を生成します。公開合成データの固定問題集であり、人間によって妥当性を検証したモデルランキングではありません。

benchmarks/officialはKyalulu Runtimeの状態、記憶、保存、共通プロンプトなどを使う別トラックです。CharacterBenchのCoreとSystemも混ぜません。同梱System bridgeは参考セッションアダプターで、実際のKyaluluアプリとの統合ではありません。MITはこのサブディレクトリのコードと新作コーパスに適用され、本体のAGPLを変更しません。

推論なしで構成を確認する#

Python 3.10以上で動き、実行時は標準ライブラリだけを使います。作業場所はbenchmarks/characterbenchです。最初はデータ検証と呼び出し計画だけを見れば、モデルやAPIキーは不要です。

Set-Location benchmarks/characterbench
python -m kcb validate
python -m kcb plan --suite all --repeats 3
# 任意:固定MOCK応答のレポート。新しい出力先を使う
python -m kcb demo --out runs/my-demo

planはネットワークを呼びません。allの1反復は264応答、3反復は792応答、smokeは22応答です。自由文の採点単位はallで84個、smokeで7個。12ターン対話は対話全体で1単位とします。demoは固定MOCKの操作確認で、実モデルの速度や品質の結果ではありません。リポジトリ版にはZIP配布版のHTMLランチャーはありません。

機械採点とキャラ品質を分ける#

runの主な機械指標は厳密JSONの状態診断正答率と項目別エラーです。文字数や箇条書きなどの表面条件も確認できますが、人格の魅力、日本語の自然さ、物語の良さをキーワード一致から推定しません。自由文の意味評価には別LLMのrubric採点、順序を反転したA/B比較、または人間によるブラインド評価が必要です。

LLM採点は未校正で、根拠引用の実在確認は採点の正しさの証明ではありません。評価数、未評価数、採点エラー、順序依存を合わせて読みます。少人数の好みや1台のGemmaパイロットから総合順位を断定しないでください。Core/System、データhash、プロトコル、反復数をそろえ、実行条件と採点条件を別々に残します。

実モデルを比べる前の確認#

  1. OpenAI互換チャットサーバーを自分で起動し、モデルをロードします。ツールは自動ダウンロードや起動をしません。doctorで正確なモデルIDを確認し、smokeから始めます。--probeやrunは実際の生成を伴います。
  2. モデル重み、量子化、backend版、thinking、MTP、サンプリングを記録し、条件を変えたら新しい出力先を使います。
  3. 応答、エラー、欠測、manifestを保存し、完了表示だけで品質合格にしません。token上限で切れた本文や非正常終了は監査用に残しますが、採点や後続対話には使いません。
  4. 同条件の再開は--resume、失敗の再試行だけは--retry-errorsを明示します。成功応答を引き直して良い結果だけ選ぶ機能ではありません。

usageがなければtoken数・料金は未測定で、ゼロではありません。観測可能な思考出力がなくても内部処理の不在は証明できません。保存済み応答のregradeは再推論せず、生成版と採点版を分けます。公開前は生の入力や履歴を確認し、人間評価のモデル対応キーを採点者へ配らないでください。Runtimeとの役割分担は開発ガイド、全体の入口はドキュメント一覧にあります。

この記事の出典

公開GitHubの資料をもとに編集。リンクは確認時のコミットに固定しています。

ガイドを検索

↑ ↓ 選択 · Enter 開く · Esc 閉じる