METHODOLOGY
速さを測る。
仕事を確かめる。
へつほつは、単一のスコアではなく、実際のタスクを最後まで完了できるかを中心にLocal AIを評価します。
LAST UPDATED / 2026年9月22日
01
問いを先に固定する
検証前に「誰が、何を完了したいか」と合格条件を定義します。Coding Agentであれば、コード生成量ではなく、既存リポジトリの理解、変更の正しさ、テスト結果、やり直し回数までを評価対象にします。
02
比較条件を記録する
機材、OS、モデルのbuildと量子化、runtime、context長、主要設定、入力、実行時刻を記録します。結果だけを掲載せず、可能な範囲で再現条件と検証の制約を併記します。
03
証拠レベルを分ける
TESTED
へつほつが記録した条件で実機検証した事実。
COMMUNITY
公式資料や第三者の再現可能な報告に基づく情報。
ESTIMATED
既知の仕様や測定値から導いた推定。根拠と不確実性を示します。
04
失敗を除外しない
モデルがロードできない、メモリが足りない、処理が止まる、誤った変更をする、完了までに人の介入が必要になる。こうした失敗は外れ値ではなく、購入判断に必要な結果として記録します。
05
限界と更新
Local AIの結果は、モデル、runtime、OS、設定の更新で変わります。記事には検証日と条件を示し、重要な更新時は旧結果を無言で上書きせず、再検証または変更履歴で扱います。