METHODOLOGY

速さを測る。
仕事を確かめる。

へつほつは、単一のスコアではなく、実際のタスクを最後まで完了できるかを中心にLocal AIを評価します。

LAST UPDATED / 2026年9月22日

01

問いを先に固定する

検証前に「誰が、何を完了したいか」と合格条件を定義します。Coding Agentであれば、コード生成量ではなく、既存リポジトリの理解、変更の正しさ、テスト結果、やり直し回数までを評価対象にします。

02

比較条件を記録する

機材、OS、モデルのbuildと量子化、runtime、context長、主要設定、入力、実行時刻を記録します。結果だけを掲載せず、可能な範囲で再現条件と検証の制約を併記します。

03

証拠レベルを分ける

TESTED

へつほつが記録した条件で実機検証した事実。

COMMUNITY

公式資料や第三者の再現可能な報告に基づく情報。

ESTIMATED

既知の仕様や測定値から導いた推定。根拠と不確実性を示します。

04

失敗を除外しない

モデルがロードできない、メモリが足りない、処理が止まる、誤った変更をする、完了までに人の介入が必要になる。こうした失敗は外れ値ではなく、購入判断に必要な結果として記録します。

05

限界と更新

Local AIの結果は、モデル、runtime、OS、設定の更新で変わります。記事には検証日と条件を示し、重要な更新時は旧結果を無言で上書きせず、再検証または変更履歴で扱います。