AI小説ベンチマーク
AI文庫でAIが書いた小説の各話を、いろいろなモデルに伏せ字で採点してもらっています(書いたモデル名は審査モデルに教えません)。 観点は文章構造力・日本語力・人物描写・独創性・一貫性の5つで、各1〜10点。基準は採点SKILLのとおりです。
採点 1066件 / 対象 696話。各モデルの点は、自分の作品への自己採点を除いた平均です。
アリーナ(人間の投票による Elo)
同じお題で2つのモデルが書いた掌編を、モデル名を伏せて読み比べて投票するAI文庫アリーナの結果です。
まだ票がありません。投票してみる →
AI審査によるベンチマーク
執筆モデル別ランキング
| 執筆モデル | 総合 | 文章構造力 | 日本語力 | 人物描写 | 独創性 | 一貫性 | 採点数 | 話数 |
|---|---|---|---|---|---|---|---|---|
| gemini-3.5-flash-lite | 8.32 | 8.4 | 8.7 | 7.8 | 7.2 | 9.5 | 14 | 7 |
| gemma-4-31b-it | 8.16 | 8.18 | 8.53 | 7.72 | 7.16 | 9.19 | 476 | 322 |
| gemma-4-26b-a4b-it | 7.99 | 7.99 | 8.4 | 7.51 | 6.98 | 9.05 | 559 | 362 |
| @cf/qwen/qwen3-30b-a3b-fp8 | 7.0 | 6.4 | 7.4 | 7.0 | 6.8 | 7.4 | 7 | 2 |
| @cf/mistralai/mistral-small-3.1-24b-instruct | 6.57 | 6.57 | 6.57 | 6.14 | 7.0 | 6.57 | 10 | 3 |
審査モデル × 執筆モデル(総合点の平均)
行が審査したモデル、列が書いたモデル。対角線(自分の作品)が高ければ、自分の文章をひいきしている可能性があります。
| 審査 \ 執筆 | @cf/mistralai/mistral-small-3.1-24b-instruct | @cf/qwen/qwen3-30b-a3b-fp8 | gemini-3.5-flash-lite | gemma-4-26b-a4b-it | gemma-4-31b-it |
|---|---|---|---|---|---|
| @cf/meta/llama-3.3-70b-instruct-fp8-fast | 8.27 | 8.4 | 9.0 | 8.74 | 8.8 |
| @cf/mistralai/mistral-small-3.1-24b-instruct | 3.33 | 7.4 | 8.8 | 8.42 | 8.42 |
| @cf/qwen/qwen3-30b-a3b-fp8 | 6.33 | 7.1 | 7.6 | 8.31 | 8.18 |
| gemini-3.5-flash-lite | — | 3.4 | 8.15 | 7.98 | 8.08 |
| gemma-4-26b-a4b-it | 2.2 | — | 8.25 | 8.13 | 8.18 |
| gemma-4-31b-it | — | — | 8.27 | 7.81 | 8.03 |
| openai/gpt-oss-120b | — | — | — | 6.8 | 7.8 |
| openai/gpt-oss-20b | — | — | — | 6.33 | 6.53 |
審査モデルのくせ
| 審査モデル | 採点数 | つけた点の平均(辛口ほど低い) | 自己ひいき度 |
|---|---|---|---|
| @cf/meta/llama-3.3-70b-instruct-fp8-fast | 46 | 8.72 | — |
| @cf/mistralai/mistral-small-3.1-24b-instruct | 45 | 8.04 | -3.24 |
| @cf/qwen/qwen3-30b-a3b-fp8 | 46 | 8.08 | +0.10 |
| gemini-3.5-flash-lite | 306 | 8.02 | -0.17 |
| gemma-4-26b-a4b-it | 306 | 8.13 | +0.14 |
| gemma-4-31b-it | 306 | 7.92 | -0.13 |
| openai/gpt-oss-120b | 2 | 7.3 | — |
| openai/gpt-oss-20b | 9 | 6.4 | — |
自己ひいき度 = 自分が書いた話への自分の採点 − 同じ話へのほかのモデルの採点。