通常のランダムK-Foldを金融時系列へ使うと、未来データが訓練へ入りやすくなります。さらにラベルが10日後までの価格で決まる場合、開始日が別でも保有期間が重なれば同じ値動きを共有します。Purgingは重複標本を除き、Embargoは検証直後に空白期間を置きます。
- 数値が表すものと、表さないものを分ける
- 未来情報を混ぜずに検証する手順を作る
- 予測精度ではなく費用後損益と損失管理で評価する
なぜこの指標・モデルが必要なのか
通常のランダムK-Foldを金融時系列へ使うと、未来データが訓練へ入りやすくなります。さらにラベルが10日後までの価格で決まる場合、開始日が別でも保有期間が重なれば同じ値動きを共有します。Purgingは重複標本を除き、Embargoは検証直後に空白期間を置きます。
仕組みを分解する
各標本に特徴量時刻だけでなく、ラベルが確定する終了時刻を持たせます。検証標本の情報区間と重なる訓練標本を削除するのがPurgingです。Embargoでは検証区間の直後一定期間を訓練から外し、近接データ間の漏洩や逐次依存を弱めます。

計算例と数字の読み方
5分割で第3区間を検証し、各ラベル最大保有10日なら、第3区間へ跨ぐ第2区間末尾の訓練標本を除きます。Embargoを全標本の1%または最大保有期間相当に設定し、第3区間直後も除外します。固定日数と割合のどちらが妥当かはラベル期間で決めます。
売買・リスク管理への落とし込み
通常K-FoldでAUC0.72、Purged CVで0.56なら、失われた0.16はモデル能力ではなく漏洩だった可能性があります。数値が下がることは失敗ではありません。運用前に過大評価を発見できた成果です。最終テスト期間はCVにも使わず最後まで封印します。
実装手順:データから検証まで
各イベントの開始・終了時刻をテーブル化し、foldごとに区間重複を判定します。標準化、特徴選択、欠損補完も各訓練fold内だけでfitします。Combinatorial Purged CVも検討し、単一分割の偶然を減らします。fold別損益分布とパラメータ安定性を保存します。
- 仮説を一文にする:何が起きた後、どの期間に、何が変化すると考えるかを先に固定します。
- 時点を再現する:約定時刻、気配時刻、企業イベント時刻をそろえ、その瞬間に取得できた情報だけで特徴量を計算します。
- 基準戦略を置く:複雑なモデルだけを評価せず、売買しない場合、単純移動平均、等金額などと同条件で比較します。
- 費用を引く:手数料、スプレッド、価格インパクト、借株料、未約定を別々に見積もります。
- 未知期間で固定する:閾値や窓を凍結し、結果が悪くても途中で変更せず記録します。

バックテストで最低限残す指標
年率リターンや勝率だけでは足りません。取引回数、平均保有時間、グロス利益、スプレッド負担、価格インパクト、最大ドローダウン、最悪10取引、銘柄別寄与、時間帯別寄与を分離します。パラメータを少し変えただけで利益が消えるなら、発見したのは市場構造ではなく標本固有の偶然かもしれません。
さらに、シグナル発生から注文送信までの遅延を100ミリ秒、1秒、5秒など複数置き、成績の減衰を調べます。理論上の終値やミッド価格でのみ約定する検証は避け、買いはアスク、売りはビッドを基本に、参加率が高い注文には追加のインパクトを課します。
資金管理の具体例
1回の許容損失を運用資金の0.25%とし、損切りまでの想定価格幅が0.8%、通常のスリッページが0.1%なら、実効損失幅は0.9%です。運用資金1,000万円なら許容損失2万5,000円÷0.009で、建玉上限は約277万円です。ただし板に対して大き過ぎる場合は、出来高参加率による上限を優先します。モデルの確信度が上がったからといって許容損失そのものを増やさない方が、検証誤差に耐えやすくなります。
よくある失敗と停止条件
Purgingだけで探索回数やレジーム偏りは解決しません。Embargoを長くし過ぎると訓練データが減り、短過ぎると漏洩が残ります。検証設計を成績が良くなるまで変更せず、ラベルの情報期間から機械的に決めます。
停止条件は損益だけでなく、入力データ欠損、スプレッド急拡大、推定係数の範囲逸脱、モデル残差の構造変化にも置きます。異常時に自動で新規注文を止め、既存建玉をどの価格・時間で縮小するかを事前に決めます。停止後に原因を確認せず同じ設定で再開すると、モデル劣化と一時的ノイズを区別できません。
小さく導入するための4段階テスト
第一段階は売買を伴わないシャドー運用です。実時刻にシグナルを記録し、取得遅延、欠損、計算時間を測ります。第二段階は最小単位での実注文です。バックテストが仮定した価格と実約定の差を、銘柄・時間帯・注文方式別に分解します。第三段階では通常予定額の25%、第四段階では50%へ増やします。各段階を一定取引数こなすまで進めず、利益が出た日数だけを昇格条件にしません。
昇格判定には、想定スリッページに対する実績、注文拒否率、未約定率、シグナルから約定までの遅延、最大日次損失を使います。例えば実スリッページの中央値が想定の1.5倍、95%点が2倍を超えた場合は、資金を増やす前にコストモデルを再推定します。取引量を増やした瞬間に価格影響が非線形に大きくなるため、少額での成功を比例拡大しないことが重要です。
成績が良く見えたときに確認すること
まず、利益が数日・数銘柄へ集中していないかを確認します。上位5取引を除くと損失になるなら、再現性より偶然の影響が大きい可能性があります。次に、同じ日の複数取引を独立標本として数えていないかを見ます。共通ニュースで同時に動いた取引は実質一つのベットです。日次またはイベント単位へ集約して信頼区間を計算します。
パラメータの近傍も重要です。窓20だけが利益で、19と21が損失なら採用を保留します。窓15〜30、閾値1.5〜2.5など合理的な範囲で収益面が滑らかに残るかを調べます。また、相場上昇期、下落期、高ボラ期、低ボラ期へ分け、どの環境で損益が生まれたかを確認します。全環境で勝つ必要はありませんが、不得意環境をリアルタイムで識別できないなら、年間平均だけを根拠に大きな資金を置けません。
実務チェックリスト
- データのタイムゾーンと同時刻処理を固定したか
- 価格調整、限月交代、売買停止を処理したか
- 未来情報を使わず特徴量と標準化を計算したか
- パラメータ選択回数と不採用結果を保存したか
- スプレッド、手数料、インパクトを差し引いたか
- 通常時だけでなく急変時の損失を確認したか
- モデル停止・再開の責任者と条件を決めたか
まとめ
高度な指標は、単独で売買方向を教える魔法のサインではありません。価値があるのは、曖昧だった需給、流動性、変動、状態変化を測定可能な形へ変え、どの条件で使えなくなるかまで定義できる点です。計算式、入力時点、費用、停止条件をセットで設計し、単純な基準より未知期間の判断が改善したときにだけ採用します。


コメント