開発・評価する
CharacterBenchで何を測れるか
12キャラ・264応答の固定パイロットで、機械採点とキャラ品質を分けて比較する。
このガイドの要点
- CharacterBenchは日本語Character AIを評価する独立したMITライセンスのパイロットです。
- 12キャラ、120単発問題、12本の12ターン対話で、モデル・反復ごとに264応答を生成します。
- 構造化状態や表面条件の点数を、キャラクター品質の総合点や検証済みランキングとして扱いません。
本体ベンチとは別の評価系#
CharacterBench v0.1は、日本語キャラクターAIを比較する独立したMITライセンスの工学パイロットです。12人のオリジナル成人架空キャラ、120単発プローブと12本の12ターン対話から、モデルごと・1反復あたり264応答を生成します。公開合成データの固定問題集であり、人間によって妥当性を検証したモデルランキングではありません。
benchmarks/officialはKyalulu Runtimeの状態、記憶、保存、共通プロンプトなどを使う別トラックです。CharacterBenchのCoreとSystemも混ぜません。同梱System bridgeは参考セッションアダプターで、実際のKyaluluアプリとの統合ではありません。MITはこのサブディレクトリのコードと新作コーパスに適用され、本体のAGPLを変更しません。
推論なしで構成を確認する#
Python 3.10以上で動き、実行時は標準ライブラリだけを使います。作業場所はbenchmarks/characterbenchです。最初はデータ検証と呼び出し計画だけを見れば、モデルやAPIキーは不要です。
Set-Location benchmarks/characterbench
python -m kcb validate
python -m kcb plan --suite all --repeats 3
# 任意:固定MOCK応答のレポート。新しい出力先を使う
python -m kcb demo --out runs/my-demoplanはネットワークを呼びません。allの1反復は264応答、3反復は792応答、smokeは22応答です。自由文の採点単位はallで84個、smokeで7個。12ターン対話は対話全体で1単位とします。demoは固定MOCKの操作確認で、実モデルの速度や品質の結果ではありません。リポジトリ版にはZIP配布版のHTMLランチャーはありません。
機械採点とキャラ品質を分ける#
runの主な機械指標は厳密JSONの状態診断正答率と項目別エラーです。文字数や箇条書きなどの表面条件も確認できますが、人格の魅力、日本語の自然さ、物語の良さをキーワード一致から推定しません。自由文の意味評価には別LLMのrubric採点、順序を反転したA/B比較、または人間によるブラインド評価が必要です。
LLM採点は未校正で、根拠引用の実在確認は採点の正しさの証明ではありません。評価数、未評価数、採点エラー、順序依存を合わせて読みます。少人数の好みや1台のGemmaパイロットから総合順位を断定しないでください。Core/System、データhash、プロトコル、反復数をそろえ、実行条件と採点条件を別々に残します。
実モデルを比べる前の確認#
- OpenAI互換チャットサーバーを自分で起動し、モデルをロードします。ツールは自動ダウンロードや起動をしません。doctorで正確なモデルIDを確認し、smokeから始めます。--probeやrunは実際の生成を伴います。
- モデル重み、量子化、backend版、thinking、MTP、サンプリングを記録し、条件を変えたら新しい出力先を使います。
- 応答、エラー、欠測、manifestを保存し、完了表示だけで品質合格にしません。token上限で切れた本文や非正常終了は監査用に残しますが、採点や後続対話には使いません。
- 同条件の再開は--resume、失敗の再試行だけは--retry-errorsを明示します。成功応答を引き直して良い結果だけ選ぶ機能ではありません。
usageがなければtoken数・料金は未測定で、ゼロではありません。観測可能な思考出力がなくても内部処理の不在は証明できません。保存済み応答のregradeは再推論せず、生成版と採点版を分けます。公開前は生の入力や履歴を確認し、人間評価のモデル対応キーを採点者へ配らないでください。Runtimeとの役割分担は開発ガイド、全体の入口はドキュメント一覧にあります。
この記事の出典
公開GitHubの資料をもとに編集。リンクは確認時のコミットに固定しています。
- benchmarks/characterbench/README.md
- benchmarks/characterbench/README_JA.md
- benchmarks/characterbench/data/README.md
- benchmarks/official/README.md
- README.md
eea271b誤記・改善を報告 ↗