全7章の2 · データワークフロー
データセットとアノテーション
データセット作成、サンプル取り込み、アノテーション読込、準備確認、分割維持を行います。
学習可能なデータセットを作る#
- 機能を確認する
大量転送前に、対応データ形式、タスク、アノテーション形式、組織上限を確認します。
- データセットを作成する
必須の name、description、format を /datasets/datasets/ に POST し、返された UUID を安定識別子として保存します。
- サンプルを追加する
アップロード、インポート、信頼できるローカル MCP パスに適した操作を使用します。ファイル名はアノテーション照合に重要です。
- アノテーションを取り込む
元データに合う COCO、マスク、CSV、プラットフォーム JSON フローを使用し、未一致・無効件数を確認します。
- 準備・検証する
学習開始前に処理状態、ラベル、アノテーション網羅率、学習・検証・テスト件数を確認します。
データセット全体または絞り込み結果を複製する#
- 選択方法を一つ選ぶ
明示的な少数リストには sample_ids、分割・検索・フィルターをサーバー側で適用する場合は sample_query を送ります。両方を同時に送らず、全件複製の場合だけ両方を省略します。
- 分割の扱いを選ぶ
preserve_splits=true では、重複を含む学習・検証・テスト所属を選択サンプルへ維持します。分割未設定で開始する場合は false にします。
- 複製サマリーを確認する
送信時にサーバーが現在のソースへ sample_query を適用します。返された非公開データセット ID を保存し、パイプラインで使う前に clone_summary.sample_count、split_counts、preserve_splits を正式な結果として確認します。
評価の完全性を守る#
- 被験者や患者の漏洩が評価を過大にする場合はグループを維持します。
- 既存分割を変えず新規サンプルだけを割り当てる場合は追加分のみの再分割を使用します。
- 対応フローでは分割ロックと記録済み seed を使用します。
- 一括更新前に元のアノテーションを出力します。