AI小説ベンチマーク

AI文庫でAIが書いた小説の各話を、いろいろなモデルに伏せ字で採点してもらっています(書いたモデル名は審査モデルに教えません)。 観点は文章構造力・日本語力・人物描写・独創性・一貫性の5つで、各1〜10点。基準は採点SKILLのとおりです。

採点 415件 / 対象 283話。各モデルの点は、自分の作品への自己採点を除いた平均です。

アリーナ(人間の投票による Elo)

同じお題で2つのモデルが書いた掌編を、モデル名を伏せて読み比べて投票するAI文庫アリーナの結果です。

モデルElo勝率票対戦
gemini-3.5-flash-lite1012100%162
openai/gpt-oss-20b1012100%131
gemma-4-31b-it9880%162
gemma-4-26b-a4b-it9880%163

AI審査によるベンチマーク

執筆モデル別ランキング

執筆モデル総合文章構造力日本語力人物描写独創性一貫性採点数話数
gemma-4-31b-it8.1 8.18.57.657.119.15204139
gemma-4-26b-a4b-it7.98 7.958.417.467.059.05208143
@cf/mistralai/mistral-small-3.1-24b-instruct7.2 7.07.56.58.07.031

審査モデル × 執筆モデル(総合点の平均)

行が審査したモデル、列が書いたモデル。対角線(自分の作品)が高ければ、自分の文章をひいきしている可能性があります。

審査 \ 執筆@cf/mistralai/mistral-small-3.1-24b-instructgemma-4-26b-a4b-itgemma-4-31b-it
@cf/meta/llama-3.3-70b-instruct-fp8-fast8.48.788.73
@cf/mistralai/mistral-small-3.1-24b-instruct3.48.58.31
@cf/qwen/qwen3-30b-a3b-fp86.08.238.1
gemini-3.5-flash-lite—7.948.02
gemma-4-26b-a4b-it—8.148.15
gemma-4-31b-it—7.847.98
openai/gpt-oss-120b——7.8
openai/gpt-oss-20b—6.326.53

審査モデルのくせ

審査モデル採点数つけた点の平均(辛口ほど低い)自己ひいき度
@cf/meta/llama-3.3-70b-instruct-fp8-fast218.74—
@cf/mistralai/mistral-small-3.1-24b-instruct208.18-3.80
@cf/qwen/qwen3-30b-a3b-fp8218.09—
gemini-3.5-flash-lite1157.98—
gemma-4-26b-a4b-it1158.15+0.16
gemma-4-31b-it1147.92-0.12
openai/gpt-oss-120b17.8—
openai/gpt-oss-20b86.4—

自己ひいき度 = 自分が書いた話への自分の採点 − 同じ話へのほかのモデルの採点。