AI小説ベンチマーク

AI文庫でAIが書いた小説の各話を、いろいろなモデルに伏せ字で採点してもらっています(書いたモデル名は審査モデルに教えません)。 観点は文章構造力・日本語力・人物描写・独創性・一貫性の5つで、各1〜10点。基準は採点SKILLのとおりです。

採点 520件 / 対象 358話。各モデルの点は、自分の作品への自己採点を除いた平均です。

アリーナ(人間の投票による Elo)

同じお題で2つのモデルが書いた掌編を、モデル名を伏せて読み比べて投票するAI文庫アリーナの結果です。

モデルElo勝率票対戦
gemini-3.5-flash-lite1012100%181
openai/gpt-oss-20b1012100%143
gemma-4-31b-it9880%180
gemma-4-26b-a4b-it9880%182

AI審査によるベンチマーク

執筆モデル別ランキング

執筆モデル総合文章構造力日本語力人物描写独創性一貫性採点数話数
gemma-4-31b-it8.11 8.128.527.647.149.15231155
gemma-4-26b-a4b-it8.0 7.978.417.497.039.07283201
@cf/mistralai/mistral-small-3.1-24b-instruct7.2 7.257.56.757.57.062

審査モデル × 執筆モデル(総合点の平均)

行が審査したモデル、列が書いたモデル。対角線(自分の作品)が高ければ、自分の文章をひいきしている可能性があります。

審査 \ 執筆@cf/mistralai/mistral-small-3.1-24b-instructgemma-4-26b-a4b-itgemma-4-31b-it
@cf/meta/llama-3.3-70b-instruct-fp8-fast8.28.778.74
@cf/mistralai/mistral-small-3.1-24b-instruct3.38.458.3
@cf/qwen/qwen3-30b-a3b-fp86.28.188.06
gemini-3.5-flash-lite—7.978.03
gemma-4-26b-a4b-it—8.098.17
gemma-4-31b-it—7.867.98
openai/gpt-oss-120b——7.8
openai/gpt-oss-20b—6.326.53

審査モデルのくせ

審査モデル採点数つけた点の平均(辛口ほど低い)自己ひいき度
@cf/meta/llama-3.3-70b-instruct-fp8-fast258.71—
@cf/mistralai/mistral-small-3.1-24b-instruct257.99-3.90
@cf/qwen/qwen3-30b-a3b-fp8257.98—
gemini-3.5-flash-lite1458.0—
gemma-4-26b-a4b-it1468.12+0.09
gemma-4-31b-it1457.92-0.13
openai/gpt-oss-120b17.8—
openai/gpt-oss-20b86.4—

自己ひいき度 = 自分が書いた話への自分の採点 − 同じ話へのほかのモデルの採点。