
Nishika株式会社(本社:東京都品川区、代表取締役CEO:山下達朗、代表取締役CTO:松田裕之)は、経済産業省・国立研究開発法人新エネルギー・産業技術総合開発機構(NEDO)が推進する「GENIAC(Generative AI Accelerator Challenge)」プロジェクトの成果として、日本語の会議要約タスクにおける指示追従性を測る評価ベンチマーク「J-MeetEval」を開発し、GitHubおよびHugging Face上でオープンソースとして公開しました。
J-MeetEvalは、3,000〜11,000字の会議文字起こしに対して「数値は全角で統一」「発言順に並べる」「指定のJSON形式で出力」といった実務さながらの形式・制約を複数同時に課し、その遵守可否を0/1の二値で採点します。4B〜9Bクラスの7モデルを評価した結果、汎用ベンチマーク「Nejumi Leaderboard」での総合スコアの順位と、J-MeetEvalでの指示達成率の順位は逆相関(スピアマン順位相関係数 ρ = −0.52)を示し、「汎用性能が高いモデルが、そのまま良い議事録を書けるとは限らない」ことが定量的に確認されました。
開発背景:会議AIの品質は「文章のうまさ」では測れない
AI議事録の導入が進むなかで、現場から返ってくる不満の多くは「日本語がおかしい」ではなく、「指定した形式で出てこない」というものです。全角で揃えてほしい数字が半角で混ざる、発言順に並べてほしい議事録が話題ごとに再構成される、決定事項だけを抜き出してほしいのに親切なToDoリストまで付いてくる——議事録として使えるかどうかは、こうした「指示どおりに出せるか」で決まります。
しかし既存のLLM評価ベンチマークには、この観点を測る枠組みが十分にありませんでした。当社は以下の3点を課題として整理しました。
-
採点の再現性 LLMが他のLLMの回答を採点する「LLM-as-a-Judge」方式は、同じ評価を繰り返しただけで判定が入れ替わる、長い回答を高く評価してしまう(verbosity bias)、提示順序で評価が変わる(position bias)といった偏りが知られています。
-
形式・制約の遵守が測定対象に入っていない 実務では文章の巧拙より「指定された形式で出力できるか」が重要ですが、既存ベンチマークではこれが明示的な減点対象になっていません。指示追従性に特化したベンチマーク「IFEval」は英語のみを対象としており、文体・敬語・全角半角・役職の付与といった日本語固有の観点は含まれていません。
-
出題形式が実務と乖離 既存ベンチマークの多くは短いプロンプトに指示1つという形式です。実務では数千〜1万字の会議文字起こしに複数の指示が同時に与えられます。
J-MeetEvalの設計:3つの課題への対処
|
課題 |
J-MeetEvalでの対処 |
|---|---|
|
採点の再現性 |
判定を0/1の二値に限定。正規表現などで機械的に判定できる指示はルールベースを優先し、LLM判定を使う場合も判定理由を全件保存 |
|
形式・制約の遵守 |
制約そのものを出題対象化。日本語固有の観点(文体・敬語・全角半角・役職付与など)を含める |
|
出題形式の乖離 |
入力を長文の会議文字起こしとし、1プロンプトに複数指示を同時に課す |
データセット構成
-
合成会議トランスクリプト 197件/指示定義 52件(延べ408指示)
-
16カテゴリ・27種類の指示タイプ(分量指定、出力制約、文体・表記、フォーマット、強調規則、匿名化、表形式、ToDoルール など)
-
入力長 3,000〜11,000字(中央値9,072字)。実会議データの文字数分布に合わせて合成
-
採点は既定でgpt-5-miniを使用し、1指示につき3回投票の多数決
出題例として、鉄道業界の商談会議(5,817字)に対し「数値は全角で統一」「重要なキーワードは太字で強調」「Markdown表(論点|結論|担当|期限)で出力」の3指示を同時に課す、といった設問が含まれます。
評価結果①:汎用ベンチマークの順位と一致しない
4B〜9Bクラスの7モデルを評価した結果は以下の通りです。
|
モデル |
J-MeetEval 指示達成率 |
Nejumi総合スコア |
応答長中央値 |
|---|---|---|---|
|
gemma-4-E4B-it |
83.3% |
0.6692 |
1,985字 |
|
gemma-4-E2B-it |
80.6% |
0.6564 |
2,081字 |
|
Qwen3-VL-8B-Thinking |
80.6% |
0.7021 |
1,340字 |
|
Qwen3-8B |
76.0% |
0.6900 |
1,262字 |
|
Qwen3-Swallow-8B-RL-v0.2 |
74.3% |
0.6552 |
1,649字 |
|
NVIDIA-Nemotron-Nano-9B-v2-Japanese |
73.3% |
0.7111 |
776字 |
|
Qwen3.5-4B |
72.1% |
0.7352 |
1,302字 |
Nejumi総合スコアが最も高いQwen3.5-4Bが、J-MeetEvalでは最下位。両者の順位相関はρ = −0.52とマイナスでした。
指示単位で内訳を見ると、差は「議事録として体裁を整える」種類の指示に集中しています。
|
指示タイプ |
gemma-4-E4B-it |
NVIDIA-Nemotron-Nano-9B-v2-Japanese |
|---|---|---|
|
元の分量の2割にまとめる |
83%(5/6) |
0%(0/6) |
|
発言順(時系列順)に並べる |
97%(64/66) |
52%(34/66) |
|
指定JSONスキーマで出力 |
100%(18/18) |
83%(15/18) |
|
重要キーワードを太字化 |
100%(14/14) |
86%(12/14) |
応答長中央値が776字と短いNemotronは、簡潔さが評価されやすい汎用ベンチマークでは優位に立ちますが、「指定要素を漏らさず指定分量で出す」ことが求められる議事録タスクでは劣後しました。
評価結果②:日本語固有の”つまずき”と、複合指示による性能劣化
表記統一の非対称性
「半角で統一」の達成率は98%(55/56)である一方、「全角で統一」は27%(7/26)にとどまりました。学習データに多い表記方向には従えても、その逆は苦手という非対称性が確認されました。
範囲の限定は難しい
「決定事項とその根拠となる発言のみを抽出」といった範囲限定の指示の達成率は25%(23/91)でした。
指示を組み合わせると急激に落ちる
「時系列順に並べる」指示は単体を含む全体では69%(318/460)ですが、他の指示と同時に課すと大きく低下しました。
-
匿名化と組み合わせ:29%(4/14)
-
役職付与と組み合わせ:33%(7/21)
-
JSON出力と組み合わせ:36%(5/14)
評価結果③:タスク特化学習により、4Bモデルでも8Bクラス相当へ
当社が会議要約向けに開発したモデル `nishika-inc/gemma-3-4b-it-merge` をJ-MeetEvalで評価したところ、ベースモデル(`google/gemma-3-4b-it`)から大幅な改善が確認されました。
|
指示達成率 |
プロンプト単位達成率 |
応答長中央値 |
|
|---|---|---|---|
|
ベース(gemma-3-4b-it) |
55.4%(226/408) |
28.9%(57/197) |
1,861字 |
|
自社モデル(gemma-3-4b-it-merge) |
74.3%(303/408) |
55.3%(109/197) |
2,479字 |
|
差分 |
+18.9ポイント |
+26.4ポイント |
改善幅は、指示の数が多いプロンプトほど顕著でした。
|
1プロンプトあたりの指示数 |
ベース |
自社モデル |
|---|---|---|
|
1つ(56件) |
58.9% |
82.1% |
|
2つ(71件) |
28.2% |
56.3% |
|
3つ以上(70件) |
5.7% |
32.9% |
カテゴリ別では、強調規則が46.7%→93.3%、文体・表記が50.0%→81.3%、ToDoルールが25.0%→60.7%、発言順が31.8%→54.5%へと改善。一方で表形式は100%→75.0%と低下しており、改善が一様ではないことも併せて公開しています。 この結果、4Bという小型モデルでありながら、8Bクラスの汎用モデルと同等以上の指示達成率(74.3%)を達成しました。オンプレミス環境など計算資源が限られる条件下でも、タスク特化学習によって実用品質に到達しうることを示しています。
公開物・関連リンク
J-MeetEvalは、評価コード・データセット・全スコア・判定根拠のドキュメントを含めて公開しています。
-
データセット:https://huggingface.co/datasets/nishika-inc/jmeeteval
-
全モデルのスコア:https://github.com/nishika-inc/jmeeteval/blob/main/docs/results.md
-
指示の相互作用・難易度分析:https://github.com/nishika-inc/jmeeteval/blob/main/docs/instruction_interactions.md
-
16カテゴリ・27指示タイプの定義:https://github.com/nishika-inc/jmeeteval/blob/main/docs/instructions.md
-
技術解説記事:https://zenn.dev/team_nishika/articles/2d346fd1151faa
会議・議事録用途でLLMの選定を行う企業や、日本語タスク向けのモデル開発を行う研究者・開発者が、業務適用前の事前検証に利用することを想定しています。データは合成データであり、実際の会議内容は含まれません。
GENIACプロジェクトについて
GENIAC(Generative AI Accelerator Challenge)は、経済産業省と
国立研究開発法人新エネルギー・産業技術総合開発機構(NEDO)が、日本国内の生成AI基盤モデル開発力の強化を目的として推進するプロジェクトです。当社は本プロジェクトに採択され、会議・議事録ドメインに特化した日本語モデルおよび評価基盤の開発に取り組んでいます。J-MeetEvalはその成果の一つです。
SecureMemo / SecureMemoCloudとは?
オンプレミス型AI議事録サービス「SecureMemo」とは
-
セキュリティ重視のオンプレミス設計:外部ネットワークから完全に遮断された環境で、安全に音声データを処理・保存できます。
-
圧倒的な文字起こし精度:特許技術を活用した独自開発の音声認識AI「shirushi」を搭載し、ノイズ混じりや明瞭でない音声でも正確に文字起こしできます。
-
オフライン環境での自動要約生成:オンプレミスでの生成AI要約機能を搭載し、決定事項やTODOまで整理した議事録を生成。自社フォーマットのカスタム議事録にも対応します。
-
多言語文字起こしおよび翻訳機能:約100言語の音声文字起こしと翻訳に対応しています。
-
自動話者識別:事前の声紋登録なしで、話者を高精度に識別します。さらに、話者の声紋を事前登録することで、識別精度を一層高めることも可能です。
クラウド型AI議事録サービス「SecureMemoCloud」とは
-
圧倒的な文字起こし精度:2つの特許技術を活用した独自開発の音声認識AI「shirushi」を搭載し、ノイズ混じりや明瞭でない音声でも正確に文字起こし。(※自社調べ)
-
業界特化&単語登録でさらに高精度:23業界に特化した文字起こしモデルや単語登録機能により、ビジネス現場で使う固有名詞もしっかり認識。使うほど自社の言葉に合った文字起こしへ改善するパーソナライズ校正も搭載します。
-
“ほぼ完成”の議事録やカスタム要約で自動生成:タイトル・日時・参加者・決定事項・議事要旨まで整った、実用度の高い議事録をAIが自動作成。また会社独自のフォーマットや用途別のカスタム要約テンプレートにも対応します。
-
蓄積した会議データをAIエージェントで活用:録音から議事録作成まで一気通貫。さらに蓄積した会議データにチャットで質問するだけで、決定事項やタスクなど必要な情報を即座に引き出せ、会議を組織の資産に変えます。
-
約100言語に対応し、翻訳もワンクリック:多言語会議や海外拠点との連携にもスムーズに対応。 中国語・韓国語・英語を含む100言語以上で文字起こし&翻訳。
Nishikaの目指すところ
Nishikaは「テクノロジーですべての人が誇りを持てる社会を」をビジョンに掲げ、企業の生産性を高める新たなデータ資産創出に取り組んでいます。 中でも、SecureMemo/SecureMemoCloudを通じて「企業の会議を全てデータ化する」ことをプロダクトビジョンとしており、日本のビジネス会議における会話情報を精度高く記録・構造化することで、付加価値の高い情報活用を実現することを目指しています。
|
商号 |
Nishika株式会社 / Nishika, Inc. |
|
事業内容 |
AIプロダクト事業、AIコンサルティング・開発事業 |
|
代表者名 |
代表取締役CEO 山下達朗、代表取締役CTO 松田裕之 |
|
本社所在地 |
141-0022 東京都品川区東五反田1-25-11 THE GATE GOTANDA EAST4階 |
|
アクセス |
JR山手線/京浜東北線 「五反田」徒歩6分、りんかい線「大崎駅」徒歩10分 |
|
認証・資格 |
ISO/IEC 27001:2022:GIJP-1821-IC プライバシーマーク:第10825001(03)号 |
お問い合わせ先
Nishika株式会社 広報(担当: 今野)
メール:pr@nishika.com
本記事は、Nishika, Inc.が2026年10月5日にPR TIMESで発表したプレスリリースを原文のまま掲載しています。
元のリリース:【GENIAC第3期成果】日本語の会議要約AI向け評価ベンチマーク「J-MeetEval」をオープンソースで公開。汎用ベンチマークの順位と"議事録タスクでの実力"が一致しないことを実証。