もしトレンドのTikTokやReelを見て「全く同じものを作りたいけど、自分の被写体で」と思ったことがあるなら、Seedance 2.0のビデオ・トゥ・ビデオがその答えです。動きを言葉で説明してAIが正しく推測するのを待つ代わりに、リファレンス動画(自分のクリップ、トレンドのテンプレート、動きの研究など)を入力すると、モデルがカメラ言語、テンポ、動きのスタイルを抽出し、それをあなたが選んだ被写体、シーン、オーディオを使って全く新しい生成に適用します。
このガイドでは、ビデオ・トゥ・ビデオの完全なワークフローを説明します。適切なリファレンスクリップの選び方、各プラットフォームに合わせた生成設定の方法、出力を精密に制御するプロンプトの書き方、そして問題が発生したときの修正方法を紹介します。最後には、あらゆるリファレンス動画をバイラル準備完了のショート動画に変換する再現可能なシステムと、Seedance 2.0で実行するための明確なパスが得られます。
Seedance 2.0 の Video-to-Video が実際に行うこと
ByteDance が開発し、2026年2月にリリースされた Seedance 2.0 は、1回のパスで真のマルチモーダル生成をサポートする初の公開 AI 動画モデルです。テキスト、画像、動画クリップ、音声ファイルを同時に受け入れ(1回の生成で最大12個の参照アセット)、ネイティブ同期オーディオ付きの2K動画を生成します。
マルチモーダル参照システム
中核メカニズムは @ 参照システム です。アセットをアップロードすると、それぞれに @Image1、@Video1、@Audio1 などの自動ラベルが付与され、プロンプト内で直接参照できます。単一のプロンプトは次のようになります:
@Image1はキャラクターを定義します。@Video1はカメラの動きとアクションリズムを定義します。@Audio1は感情的なペーシングを設定します。高リアリズムで、ハードカットなしの12秒の縦型ショート動画を生成してください。
これは後から音声を重ねるポストプロダクションのトリックではありません。Seedance 2.0 は、ビデオフレームとオーディオ波形を同時に生成するデュアルブランチ拡散トランスフォーマーアーキテクチャを使用しており、リップシンク、ダイアログ、効果音、環境ノイズがすべて出力に組み込まれています。
ビデオ入力が Image-to-Video と異なる点
画像間変換(image-to-video)を使用すると、モデルは単一フレームから動きを発明する必要があります。結果は、モデルが「動きがどのように見えるか」というトレーニング分布にデフォルト設定されるため、一般的なものになる可能性があります。ビデオ間変換(video-to-video)はこれを根本的に変えます。参照クリップは、カメラの動き方、アクションの展開速度、従うべきショットリズムをモデルに正確に伝えます。動きを説明するのではなく、実演しているのです。
モデルは参照クリップから動きベクトル、カメラ軌道、時間的ペーシングを抽出し、ターゲット生成にマッピングします。つまり、手持ち歩行ショットの参照は、出力に同じドキュメンタリー感を生み出します。スロードリーズームの参照は、同じ映画的な緊張感を生み出します。動きはもはや推測ではなく、制御された変数です。
動画間変換がショートフォーム制作を変える理由
2026年のショートフォーム動画は、精度が求められる量勝負の世界です。TikTok、Instagram Reels、YouTube Shortsは合わせて1日40億回以上の視聴を集めていますが、主要プラットフォームのアルゴリズムはすべて、単一の主要指標であるセッション時間を最適化します。視聴者を引きつけ、さらに重要なのは再度視聴させる動画が拡散されます。最初の1秒で視聴者を失う動画は拡散されません。
従来の方法とSeedance 2.0の方法
従来のショートフォーム制作パイプラインは次のようになります:コンセプト→撮影→編集→カラーグレーディング→音声追加→書き出し→投稿。効率的なセットアップでも、1つの洗練された15秒のクリップに数時間かかることがあります。そのクリップを反復するには、別のカメラアングルを試す、カットパターンを速くする、照明のムードを変えるなど、再撮影か大掛かりな編集が必要です。
Seedance 2.0の動画間変換では、パイプラインが生成ループに集約されます。望む動きやペーシングに合った参照クリップを見つけ、設定を一度構成し、プロンプトを書き、生成します。結果が適切でなければ、変数を1つ変更して再生成します。これにより、従来1つを編集するのにかかる時間で、ショート動画の5つの異なるバージョンをテストできます。
ショートフォームプラットフォームで最もパフォーマンスの良い形式(満足感のあるループ、変身シーン、シネマティックなワンショット、劇的な披露を伴う商品紹介)はすべて、共通の特徴を持っています:その魅力は被写体だけでなく動きにあるのです。動画間変換はその動きを直接制御できるため、スクロールで通り過ぎられるコンテンツと、親指を止めるコンテンツを分けるものとなります。
ビデオからビデオへのワークフロー:ステップバイステップ
この4ステップのプロセスは繰り返し可能に設計されています。一度実行してリズムを覚えたら、作成するすべてのショートに使用してください。
ステップ1 -- リファレンス動画を選ぶ
良いリファレンスクリップは必ずしも高品質な動画である必要はありません。それは、再現したい動きのパターンを持つクリップです。モデルはコンテンツではなく動きを抽出するため、机の上を手持ちでパンするだけのシンプルな動画でも、プロが撮影したドリー移動と同じように機能します。
Do:
- 明確で支配的な動きが1つだけのクリップを選ぶ:単一のパン、単一のトラッキングショット、単一のズーム。
- リファレンスクリップは短く保つ--3~8秒が最適です;長いリファレンスはモデルを混乱させる可能性があります。
- リファレンスの動きの速度を出力で望むものに合わせる;速いウィップパンのリファレンスは速いウィップパンの結果を生み出します。
- 一貫したフレームレートで撮影されたクリップを使用する--24fpsまたは30fpsのリファレンスが最もクリーンな抽出を生み出します。
Don't:
- 複数の素早いカメラチェンジがあるリファレンスクリップを使用しない;モデルはどの動きに従うべきかを分離するのに苦労します。
- 被写体自体が不規則に動き、同時にカメラも動くクリップを選ばない;これらの要素は分離してください。
- 高圧縮または低解像度のクリップを使用しない;圧縮アーティファクトが視覚ノイズとして出力に現れる可能性があります。
ステップ2 -- 生成設定を構成する
Seedance 2.0 インターフェースを開きます。プロンプトに触れる前に、出力設定を確定してください。この順序は重要です--プロンプトを書いた後に設定を変更すると、多くの場合プロンプトを書き直す必要があります。
ターゲットプラットフォームに基づいてアスペクト比、持続時間、解像度を設定します。持続時間は最も重要な変数です:短いクリップ(4〜8秒)は反復が速く、一貫性が保たれます。最初のテストでは、標準品質で9:16縦型で5秒間生成してください。動きと構図が適切だと感じたら、高品質で再生成します。プラットフォーム固有の詳細設定は次のセクションで説明します。
ステップ3 -- ビデオからビデオへのプロンプトを書く
Seedance 2.0のビデオからビデオへのプロンプトには、次の順序で6つのコンポーネントが必要です:
-
被写体+設定 -- シーンに誰がいるか、何があるか、そしてどこで行われるか。具体的に。「ゴールデンアワーの日当たりの良い屋上庭園に立つ、クリーム色のリネンブレザーを着た若い女性」は「外にいる人」より優れています。
-
アクション -- 1つのメインアクションを、撮影可能な用語で説明します。モデルはあなたが説明したことをアニメートするので、「彼女はゆっくりと頭をカメラに向け、微妙で理解しているような微笑みを浮かべる」は機能します。「彼女は自信があるように見える」は機能しません。
-
カメラ -- ショットタイプと動きを明示的に指定します。静的、トラッキングショット、ドリーズーム、手持ち、スローパン、クレーンアップ、ウィップパンから選択します。ここでビデオからビデオが輝きます--リファレンスクリップのカメラモーションがプロンプトのフレーミング指示と組み合わされます。
-
スタイル+照明 -- これらを一貫させます。「暖かい自然光、柔らかな影、わずかに彩度を下げたシネマティックなカラーグレード」は完全な照明設定です。
-
ペーシング+制約 -- 「ゆっくりと意図的なペーシング。急なカットなし。24fpsのフィルムライクなモーションブラー。」これにより、モデルに時間の構造化方法を指示します。
-
リファレンスタグ -- @リファレンスで終わります。ビデオからビデオの場合、
@Video1が主要なモーションリファレンスです。被写体の外観に画像を使用したり、リズムにオーディオクリップを使用している場合は、ここにそれらのタグを追加します。
完全なビデオからビデオへのプロンプトの例:
クリーム色のリネンブレザーを着た若い女性が、ゴールデンアワーの日当たりの良い屋上庭園に立っています。彼女はゆっくりと頭をカメラに向け、微妙で理解しているような微笑みを浮かべます。ミディアムクローズアップショット、手持ちで優しく揺れる。暖かい自然光、柔らかな影、わずかに彩度を下げたシネマティックなカラーグレード。ゆっくりと意図的なペーシング、カットなし、24fpsのモーションブラー。
@Video1がカメラの動きとタイミングを定義します。9:16縦型、8秒。
ステップ4 -- 生成、確認、反復
同じプロンプトから2〜4つのバリアントを生成します。単一の出力でSeedance 2.0を判断しないでください--モデルは複数のロールから恩恵を受け、1つのバリアントが常に他のものより著しく優れていることがほとんどです。
反復するときは、一度に1つの変数のみを変更します。カメラの動きがおかしいと感じたら、プロンプト内のカメラの説明を調整します--被写体ではなく、照明でもなく、リファレンスタグでもありません。被写体がずれる場合は、被写体の説明を明確にします。ペーシングが合わない場合は、ペーシングの制約を調整します。この規律は、一貫した結果を得るクリエイターと、ギャンブルをしているように感じるクリエイターを分ける最大の要因です。

プラットフォーム固有の設定:TikTok、Reels、Shorts
各プラットフォームは異なる動作に最適化されており、Seedance 2.0の設定もそれに合わせる必要があります。以下の表は、各プラットフォームの要件と、生成前に使用すべき正確な設定を対応付けています。
| 設定 | TikTok | Instagram Reels | YouTube Shorts |
|---|---|---|---|
| アスペクト比 | 9:16(フル縦) | 9:16(フル縦) | 9:16(縦、1:1も可) |
| 最適な時間 | 8~15秒 | 8~15秒 | 15秒 |
| 解像度 | 1080p(標準);高品質なアカウントは2K | 1080p | 1080p(YouTubeは2Kの圧縮が少ないため、ここでは2Kが価値あり) |
| 音声戦略 | ネイティブ音声オン;書き出し後にアプリ内で流行のサウンドを重ねる | ネイティブ音声オン;Reelsは発見のためにオリジナル音声を好む | ネイティブ音声オン;Shortsのアルゴリズムは音声の保持率を重視 |
| ループ最適化 | 重要 – 終了フレームを開始フレームに合わせてシームレスな再生を実現 | 重要 – ループは完了率シグナルを強化 | 中程度 – TikTokほどループ依存ではない |
| 投稿頻度 | 成長アカウントは1日1~2本 | 週3~5本 | 1日1本 |
| 主要なアルゴリズムシグナル | 完了率+リプレイ | 保存+共有 | 視聴時間+Shorts棚からのクリックスルー |

TikTokの詳細
TikTokのアルゴリズムは、何よりも完了率を重視します。視聴者の80%が最後まで見る15秒の動画は、50%しか見ない30秒の動画よりもパフォーマンスが良くなります(たとえ長い動画がより多くの総視聴時間を生み出しても)。Seedance 2.0のビデオtoビデオでは、最初の0.5秒に強力なビジュアルオープニングを持つ短い生成を優先することを意味します。TikTokはその0.5秒の間に動画を表示し続けるかどうかを決定します。プロンプトは、スロービルドではなく、視覚的に印象的なオープニングモーメントを記述する必要があります。
ループコンテンツは特に注意が必要です。終了フレームが自然に開始フレームに戻るとき、TikTokはすべてのリプレイを新たな完了シグナルとして扱います。Seedance 2.0でこれを達成するには、プロンプトのペーシング制約に「シームレスなループ対応の動き、終了状態が開始状態と一致する」を追加します。
Instagram Reelsの詳細
ReelsはTikTokとは異なる方法でコンテンツを配信します。純粋な完了率よりも保存と共有を優先するため、反応を引き起こしたり、友人に送る価値があると感じさせるコンテンツはアルゴリズムの追い風を受けます。ビデオtoビデオでは、反応を促すフォーマット(リアクションテンプレート、比較動画、または「後」のショットが見どころとなる変身公開)を活用します。また、Reelsは発見のためにオリジナル音声を重視します。Seedance 2.0のネイティブ音声生成を使用して流行のサウンドをインポートしないことは、コンテンツフォーマットがそれをサポートする場合、実際にリーチに役立ちます。
YouTube Shortsの詳細
YouTube Shortsは異なるエコシステムの中にあります。視聴者はYouTubeモバイルアプリのShorts棚から訪れることが多く、アルゴリズムはあなたのShortをチャンネル上の長尺コンテンツと一緒に評価します。つまり、Seedance 2.0の出力は、可能な限り、より広範なコンテンツ戦略に結び付ける必要があります。長い動画のティーザーとして機能するShort、またはチャンネルの別の場所で詳しく説明されているテクニックを紹介するShortは、複合的な配信効果を得られます。設定としては、可能であれば2K解像度で生成します。YouTubeの圧縮パイプラインは2Kを1080pよりも優しく処理し、品質の違いはモバイルでも確認できます。
バイラルフォーマット複製メソッド
これは、Seedance 2.0 のビデオツービデオを制作ツールから成長エンジンへと変えるテクニックです。考え方はシンプルです。トレンドのショートフォームフォーマットを特定し、その動作シグネチャをリバースエンジニアリングし、そのシグネチャを参照ビデオとして Seedance 2.0 に入力します。その後、自分の被写体、スタイル、創造的なひねりを加えたバージョンを生成します。
4ステップの複製プロセス
-
フォーマットの動作シグネチャを特定する。 トレンド動画をミュートで視聴します。被写体を無視し、カメラに完全に集中します。ゆっくりとしたプッシュイン、手持ちフォロー、ウィップパンレビール、フレーム内のアクションを伴う静的ロックオフショットなどです。動作シグネチャが抽出対象であり、他のすべては置き換え可能です。
-
その動作のクリーンな参照クリップを撮影または見つける。 最善の方法は、自分で5秒の参照を撮影することです。適切な速度で壁をパンする、廊下を手持ちで歩く、静止物体にゆっくりズームインするなど。モデルはフレーム内の内容を気にせず、フレームの動き方を気にします。撮影できない場合は、動作が一致し、視覚的な内容が出力に影響を与えないほどシンプルなクリップを見つけてください。
-
参照に基づいてプロンプトを構築する。 新しい被写体、設定、スタイルを詳細に記述しますが、カメラの動きは記述しないでください。
@Video1にその負担を任せます。この関心事の分離が複製メソッドの鍵です。プロンプトは「何を見るか」を担当し、参照は「どのように見るか」を担当します。 -
動きの一致ではなく、被写体の一致を反復する。 レビューの際、被写体が正しく見えるか、スタイルが適切かを評価します。動きは参照からおおよそ合っているはずです。ずれている場合、問題はほとんどの場合、プロンプトではなく参照クリップにあります。
ビデオツービデオに優れた5つのバイラルフォーマット
- 変身 (Henshin) トランスフォーメーション: 被写体、環境、スタイルがクリップ内で劇的に変化するビフォーアフターレビールです。カメラはロックオフで固定され、魔法は変身そのものにあります。静的な三脚撮影を参照し、プロンプトで変化を説明します。
- サティスファイングループ: 終了状態が開始と一致するシームレスで催眠的なモーションサイクルです。水銀のようなモーフィング、流体シミュレーション、キネティックタイポグラフィループなどが効果的です。制約条件に「シームレスループ対応モーション」を追加します。
- シネマティックワンショット: 豊かに詳細なシーンを通る途切れのない単一のカメラムーブメントです。スムーズなトラッキングまたはドリーショットを参照し、前景、中景、背景の深度レイヤーがあるシーンを説明します。
- プロダクトリビール: 劇的な披露です。ゆっくりとしたカメラの動き、披露に向けて盛り上がる照明、影や動きから現れる製品。プッシュインまたはクレーンアップを参照し、プロンプトで製品と照明の流れを説明します。
- リアクションテンプレート: フレームの一方が他方に反応する分割フォーマットです。これは、Seedance 2.0 で「反応」側を生成し、既存の映像と組み合わせると最も効果的です。ロックオフショットを参照し、反応のパフォーマンスを詳細に説明します。
よくあるビデオ間変換の問題とその修正方法
ビデオ間変換は強力ですが、魔法ではありません。出力が意図したものと一致しない場合、修正点はほぼ常に次の3つのうちのいずれかにあります:参照クリップ、プロンプト構造、または生成設定。ここでは、最も頻繁に発生する問題の診断と解決方法を説明します。
| 症状 | 考えられる原因 | 修正方法 |
|---|---|---|
| 動きがぎくしゃくしたり、混沌としている | 参照クリップに複数の競合する動きがある。または、プロンプトが参照と競合するカメラの動きを説明している | 1つの明確な動きを持つ参照クリップを使用する。プロンプトからカメラの動きに関する言葉をすべて削除する — @Video1 に動きを完全に任せる |
| 被写体がクリップの途中で外見が変わる(キャラクタードリフト) | プロンプトが被写体を曖昧な言葉で説明している。または、画像参照が被写体の外見を固定していない | 具体的な身体的特徴で被写体の説明を明確にする。キャラクターの外見を固定する @Image1 参照を追加する |
| 出力に参照クリップの内容がにじみ出ているように見える(スタイルブリード) | 参照クリップに強い視覚コンテンツ(人物、はっきりした背景、大胆な色)が含まれており、モデルがそれをスタイル指示として扱っている | 視覚コンテンツが最小限のシンプルな参照クリップを使用する。無地の壁のパンやニュートラルな背景の動きの研究を撮影する |
| 出力の長さが間違っている | プロンプト作成後に長さ設定が変更された。または、プロンプトが設定された長さよりも長いアクションを説明している | プロンプトを作成する前に長さを設定する。アクションの範囲を長さに一致させる:5秒のクリップには1つの短いアクションを説明し、連続したアクションは説明しない |
| オーディオがビジュアルと一致しない | オーディオ参照クリップが長すぎるか、競合する音のシグネチャが含まれている。または、generate_audio が有効になっていない | 10秒未満のオーディオクリップを使用する。オーディオの感情曲線をプロンプトのペースに合わせる。オーディオ生成がオンになっていることを確認する |
| 「レンズスイッチ」でクリーンなカットが生成されない | キーワードがプロンプト内の間違った位置に配置された。または、長さに対して要求されたカットが多すぎる | プロンプト内の正確な遷移ポイントに「レンズスイッチ」を配置する。15秒の生成につき1回または2回のスイッチに制限する |
最も信頼できるトラブルシューティングの習慣:最後に成功した生成を保持し、変数を1つだけ変更して、並べて比較すること。参照クリップ、プロンプト、長さをすべて同時に変更すると、何が問題を修正したのか、または以前動作していた設定を何が壊したのかが決してわかりません。
FAQ: クリエイターが実際に尋ねる質問
参考として任意の動画を使用できますか、それとも制限がありますか?
使用できるのは、権利を有する動画のみです。モデルは参照動画の視覚的なコンテンツではなく、モーションとカメラデータを抽出しますが、参照クリップ自体には著作権が適用されます。最も安全な方法は、自分で参照映像を撮影することです。5秒のパンやトラッキングショットは数分で撮影でき、権利に関する懸念がなくなります。
参照動画の長さはどのくらいが適切ですか?
3~8秒が理想的な範囲です。3秒未満ではモデルが扱うのに十分なモーションデータが得られません。8秒を超えると、モデルが複数のモーションパターンを抽出し、一貫性のないブレンドを生成するリスクが高まります。より長いモーションシーケンスを参照する必要がある場合は、別々の参照クリップに分割し、複数回のパスで生成してください。
ビデオ・トゥ・ビデオはSeedance 2.0の無料プランでも利用できますか?
はい。Seedance 2.0はビデオ・トゥ・ビデオ生成へのアクセスを提供しており、ほとんどのプラットフォームでは新規ユーザーが機能をテストするための無料クレジットを提供しています。サインアップ時に現在のクレジット割り当てを確認してください。無料プランには通常、完全なテストワークフローを完了するのに十分な生成回数が含まれています。
1つの参照動画から複数のショットを生成できますか?
はい。それが「lens switch」キーワードの目的です。プロンプトの遷移箇所に「lens switch」を追加すると、Seedance 2.0はキャラクターとシーンの連続性を維持しながら、新しいアングルに切り替えます。最良の結果を得るには、1回の生成につき1~2回のレンズスイッチに制限してください。
ビデオ・トゥ・ビデオとイメージ・トゥ・ビデオの違いは何ですか?
イメージ・トゥ・ビデオは静止フレームをアニメーション化します。モデルは画像内で見たものに基づいてモーションを創り出します。ビデオ・トゥ・ビデオは参照クリップから実際のモーションパターン(カメラの軌跡、アクションのスピード、ショットのリズム)を転送します。イメージ・トゥ・ビデオがダンスを説明することに例えられるなら、ビデオ・トゥ・ビデオは振り付けを見せることに例えられます。
出力が参照と比べて色褪せて見えるのはなぜですか?
これは通常、プロンプトの照明とスタイルの説明が参照クリップの視覚的な品質と競合する場合に発生します。参照が暗くムーディーであるのに、プロンプトが明るい昼光を要求すると、モデルは相反する指示に直面します。プロンプトの照明の雰囲気を参照の照明の雰囲気に合わせるか、ニュートラルで均一な照明の参照クリップを使用してください。
あなたの次のバイラルショートはここから始まる
Seedance 2.0 のビデオ間変換は、ショートフォームコンテンツ作成における最大のボトルネック、つまり効果のあるフォーマットを見てから自分のバージョンを制作できるようになるまでのギャップを取り除きます。このガイドのワークフロー(クリーンな参照を選び、プラットフォーム固有の設定を固定し、構造化された6パートのプロンプトを書き、一度に1つの変数を反復する)は、数回行えば10分以内にエンドツーエンドで実行できるように設計されています。
2026年にTikTok、Reels、Shortsで伸びるフォーマットは、被写体そのものだけでなく、モーションコントロールの精度も重視されます。うまく実行されたループ、完璧なタイミングのリビール、途切れない単一のカメラムーブ。これらは偶然ではありません。Seedance 2.0 を使って意図的に行えるクラフト上の決定であり、参照ビデオを青写真とし、モデルを実行エンジンとします。
Seedance 2.0 を開き、参照クリップを選び、上記の6パートのレシピを使って最初のプロンプトを書き、4つのバリアントを生成してください。そのうちの1つがあなたを驚かせるでしょう。それを反復するのです。それがバイラルパイプラインの始まりです。



