[논문정리] MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization
Full Text PDF
서지정보
Li, Hengjia, Lifan Jiang, Xi Xiao, 기타. “MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization”. arXiv:2503.12689. Preprint, arXiv, 2025년 3월 16일. https://doi.org/10.48550/arXiv.2503.12689.
초록(Abstract)
Video identity customization seeks to produce high-fidelity videos that maintain consistent identity and exhibit significant dynamics based on users’ reference images. However, existing approaches face two key challenges: identity degradation over extended video length and reduced dynamics during training, primarily due to their reliance on traditional self-reconstruction training with static images. To address these issues, we introduce $\textbf{MagicID}$, a novel framework designed to directly promote the generation of identity-consistent and dynamically rich videos tailored to user preferences. Specifically, we propose constructing pairwise preference video data with explicit identity and dynamic rewards for preference learning, instead of sticking to the traditional self-reconstruction. To address the constraints of customized preference data, we introduce a hybrid sampling strategy. This approach first prioritizes identity preservation by leveraging static videos derived from reference images, then enhances dynamic motion quality in the generated videos using a Frontier-based sampling method. By utilizing these hybrid preference pairs, we optimize the model to align with the reward differences between pairs of customized preferences. Extensive experiments show that MagicID successfully achieves consistent identity and natural dynamics, surpassing existing methods across various metrics.
한줄 요약
MagicID는 static reference image를 재구성하는 기존 video customization 학습 대신, identity consistency와 motion dynamics를 동시에 보상하는 pairwise preference data를 만들고 Hybrid Preference Optimization으로 학습해 ID 유지와 동작 보존을 함께 개선하는 방법이다.
MagicID는 기존 비디오 커스터마이징의 고질적 문제인 ID 일관성 저하와 움직임의 역동성 감소를 해결하기 위해, 사용자 참조 이미지로부터 ID 및 동적 보상을 직접 학습하는 Hybrid Preference Optimization 프레임워크를 제안합니다.
이 방법론은 정적 비디오와 생성된 비디오를 결합하여 ID 및 동작 품질을 극대화하는 하이브리드 샘플링 전략을 사용하며, Pareto frontier 기반의 데이터 선택을 통해 모델이 ID 보존과 풍부한 동작 역동성이라는 두 가지 목표를 동시에 달성하도록 유도합니다.
실험 결과, MagicID는 기존의 Self-reconstruction 방식이나 다른 최첨단 기법들에 비해 월등한 얼굴 일치도와 자연스러운 모션 품질을 입증하였으며, 다양한 벤치마크 평가에서 뛰어난 정량적 및 정성적 성능을 보였습니다.
하이라이트 & 내 메모
step1: peference data generation 학습에 사용할 데이터 만드는 단계. 아이덴티티 유지와 동적 표현 모두 고려하는 쌍 만든다 참조 이미지로부터 얻은 정적 영상을 포함하고 초기 T2V 모델과 LoRA로 파생된 영상
reference image, text prompt 를 입력으로 한다. 세 종류의 영상을 만든다. (a) finetuned T2V가 생성한 영상 LoRA를 이용해 personalizatin이 어느 정도 된 모델이 만든 영상 (b) initial T2V 영상 원래 T2V 모델이 만든 영상 (c) static videos reference image를 그대로 여러 프레임으로 복사
step2: custiomized video reward 세가지로 각 영상 품질 평가 ID Consistency: 참조 이미지와 영상 사이의 유사도 Dynamic Degree: 영상에서 움직임. RAFT Optical Flow를 이용 Prompt Following: 텍스트 프롬포트와 영상의 의미적 일치도 1-10까지로 평가. 각 영상 품질을 나타내는 지표
| 평가 항목 | 평가 모델 | 역할 |
|---|---|---|
| ID Consistency | Pretrained ID Encoder | 참조 이미지와 생성 영상의 ID 유사도 평가 |
| Dynamic Degree | RAFT | Optical Flow를 계산하여 움직임의 크기 평가 |
| Prompt Following | VLM (Vision-Language Model) | 프롬프트와 영상의 의미적 일치도 평가 |
step3: hybrid pair selection 무엇을 좋은 영상으로 볼 것인지
(a) identity-preferred pair ID만 거의 본다 ID Consistency점수가 높은 순으로 정렬한다. 다만 Dynamic 차이가 너무 크면 비교하지 않는다. Dynamic threshold를 둔다.
(b) dynamic-preferred pair 각 점이 하나의 영상이다 ID, motion, prompt 세가지를 고려한다 다른 점들보다 세개를 모두 잘하면 win, 모든 면에서 밀리면 lose로
win, lose를 둘다 모델이 넣어 winner는 더 잘 생성하고 loser는 덜 생성하도록 한다
주장
핵심 주장 / 방법론
핵심 주장은 비디오 identity customization의 실패 원인이 단순히 ID encoder가 약해서가 아니라, static reference image를 self-reconstruction하는 학습 목적 자체가 video generation과 맞지 않는다는 것이다. 정적 이미지만 재구성하면 identity는 짧게는 유지되어도 긴 프레임에서 무너지고, 학습이 길어질수록 영상의 motion dynamics가 줄어든다.
MagicID는 이를 preference optimization 문제로 바꾼다.
- Preference video repository 생성: 초기 LoRA fine-tuned T2V가 만든 video, 원래 T2V 모델이 만든 video, reference image를 inflate한 static video를 함께 모은다.
- Customized video reward: 각 video를 ID consistency, dynamic degree, prompt following 세 기준으로 1-10점 평가한다. ID는 face ID encoder, motion은 RAFT optical flow, prompt following은 VLM으로 측정한다.
- Hybrid pair selection: 먼저 identity-preferred pair를 골라 ID degradation을 줄이고, 이후 Pareto frontier 기반으로 identity/dynamic/prompt reward가 균형 잡힌 dynamic-preferred pair를 고른다.
- Hybrid Preference Optimization(HPO): DPO식 pairwise objective를 diffusion/video generation에 맞게 바꿔, preferred video의 generation likelihood는 올리고 rejected video는 내리도록 학습한다.
결과적으로 MagicID는 “reference image를 그대로 복원하라”가 아니라 “ID는 같고, motion은 살아 있고, prompt도 따르는 video를 선호하라”는 학습 신호를 준다.
내 생각 / 질문 / 반박
| [[Personalization]] 프로젝트 관점에서 이 논문은 중요한 방향 전환이다. 지금까지 읽은 [[DreamVideoComposingYour2023 | DreamVideo]], [[MagicMeIdentitySpecificVideo2024 | Magic-Me]], [[IdentityPreservingTexttoVideoGeneration2025 | ConsisID]]는 주로 identity signal을 어디에 어떻게 넣을지에 집중했다. MagicID는 한 단계 더 나아가 “어떤 결과를 좋은 personalized video로 볼 것인가”를 reward/preference로 직접 정의한다. |
특히 내 프로젝트에서 flickering과 motion 약화가 같이 보인다면, 단순 reconstruction loss나 ID loss만으로는 부족할 가능성이 크다. ID consistency reward만 키우면 얼굴은 유지되지만 움직임이 죽고, dynamic reward만 키우면 identity가 흔들릴 수 있다. MagicID의 hybrid pair selection은 이 trade-off를 다루는 실용적인 방법이다.
질문:
- ID reward가 face encoder similarity에 치우치면, 얼굴 외의 body/cloth personalization은 놓치지 않을까?
- preference pair를 자동 reward로 만들면 reward hacking이나 metric bias가 생기지 않을까?
[[MovieWeaverTuningFree Movie Weaver]]처럼 multi-concept setting으로 확장하려면 ID reward를 subject별로 분리해야 하지 않을까?
저자가 정말로 증명한 게 뭐고 그냥 주장만 한 게 뭔가?
증명한 것에 가까운 부분:
- self-reconstruction 기반 학습은 긴 video length에서 ID consistency가 떨어지고, training step이 늘수록 dynamic degree가 감소한다는 분석을 제시한다.
- HunyuanVideo 기반에서 MagicMe, DreamBooth+LoRA, ID-Animator, ConsisID와 비교해 Face Similarity, Dynamic Degree, CLIP-I, FVD 등에서 좋은 수치를 보인다.
- ablation에서 ID-preferred pair는 face similarity를 크게 올리고, dynamic-preferred pair를 추가하면 Dynamic Degree가 크게 오른다.
- ID reward만 쓰는 것보다 ID+Dynamic, ID+Dynamic+Semantic reward가 motion과 prompt following을 더 잘 보존한다는 ablation을 제시한다.
주장에 가까운 부분:
- “user preference”라고 하지만 실제 pair construction은 ID encoder, optical flow, VLM score 기반 자동 preference에 가깝다. 사람 선호를 직접 수집한 RLHF류 데이터는 아니다.
- DPO/HPO가 personalized video generation에 일반적으로 최적이라는 주장은 아직 제한적이다. 실험은 single-person identity customization 중심이다.
- ConsisID/ID-Animator 같은 encoder-based method와의 비교는 학습 데이터 규모, base model, inference condition이 완전히 같지 않을 수 있다.
이 결과가 놀랍나, 아니면 예상대로인가?
방향은 예상 가능하다. Static image reconstruction만 학습하면 모델은 “움직이지 않는 얼굴을 잘 복원하는 방향”으로 끌려가고, 비디오 생성에서 필요한 temporal variation은 줄어들 수밖에 없다. 따라서 dynamic reward를 명시적으로 넣으면 motion이 회복되는 것은 자연스럽다.
흥미로운 점은 정적 reference image를 inflate한 static video를 identity-preferred stage에 활용한다는 점이다. 완전히 좋은 video preference data가 없어도, static video는 identity upper bound 역할을 하고, initial/fine-tuned T2V sample은 motion diversity를 제공한다. 이 조합으로 부족한 preference data 문제를 우회한다.
저자의 결론이 실험 결과보다 과하게 일반화되진 않았나?
약간 과하다. MagicID는 ID consistency와 dynamics 사이의 trade-off를 잘 다루지만, single-person face-centric video customization에 초점이 있다. 논문도 multiple identities를 포함한 customized video는 생성하지 못한다고 명시한다.
또한 automatic reward가 실제 human preference와 얼마나 맞는지는 조심해야 한다. optical flow가 크다고 항상 좋은 motion은 아니고, face similarity가 높다고 항상 자연스러운 personalized video는 아니다.
방법론
이 방법이 왜 작동하는가, 그냥 “잘 됐다”가 아니라 원리적으로?
원리적으로는 학습 목적이 inference 목표와 더 잘 맞기 때문에 작동한다.
- 기존 self-reconstruction: reference image 한 장을 복원하는 loss이므로, 정적인 얼굴/외형을 유지하는 방향으로만 최적화된다. 비디오의 temporal variation은 학습 목표에 직접 들어가지 않는다.
- MagicID의 ID-preferred pairs: reference와 닮은 video를 preferred로 두어 identity degradation을 직접 억제한다.
- MagicID의 dynamic-preferred pairs: identity, dynamic, semantic reward의 Pareto frontier를 사용해 “움직임이 좋으면서 ID도 유지하는” 방향을 고른다.
- HPO loss: preferred/rejected video pair의 likelihood 차이를 키우므로, 모델은 단일 정답 재구성보다 좋은 video의 상대적 성질을 학습한다.
즉 MagicID는 personalization을 reconstruction 문제가 아니라 alignment 문제로 바꾼다.
숨겨진 가정이 뭔가?
- face ID encoder similarity가 실제 identity preservation을 잘 대표한다.
- RAFT optical flow 기반 dynamic degree가 자연스러운 motion quality와 충분히 맞는다.
- VLM prompt-following score가 video-text alignment를 안정적으로 평가한다.
- pairwise preference data가 자동 score로 만들어져도 HPO 학습에 충분히 신뢰할 만하다.
- personalization 대상이 single person face 중심이다.
- HunyuanVideo 같은 강한 base T2V 모델이 이미 좋은 motion prior를 가지고 있다.
- initial/fine-tuned/generated/static video repository가 충분히 다양한 win/lose pair를 제공한다.
실험 설정
- baseline이 공정한가?
Base model은 HunyuanVideo이고, 먼저 1000 step initial fine-tuning을 한 뒤 MagicID의 HPO로 5000 step 최적화한다. inference는 61-frame video를 생성한다.
Preference repository는 LLM으로 만든 prompt를 사용해 fine-tuned T2V video, initial T2V video, reference image를 inflate한 static video로 구성한다. 각 video는 ID consistency, dynamic degree, prompt following으로 점수화되고, identity-preferred pair와 dynamic-preferred pair로 나뉘어 학습에 쓰인다.
평가 데이터는 40 character와 40 action-specific prompt로 구성된다. 평가 지표는 Face Similarity, Dynamic Degree, Temporal Consistency, CLIP-T, CLIP-I, FVD이며, VBench도 사용한다. 비교 대상은 DreamBooth+LoRA, MagicMe, ID-Animator, ConsisID다.
baseline 공정성은 부분적으로 좋다. DreamBooth와 MagicMe는 HunyuanVideo 위에 적용해 비교 조건을 맞추려 한다. 다만 ID-Animator와 ConsisID는 large-scale video dataset으로 훈련된 encoder-based method라, 학습 데이터와 backbone 차이를 완전히 통제하기 어렵다.
한계
직접 명시한 limitation
논문이 직접 명시한 한계는 single-person consistent identity video generation에 집중하며, multiple identities가 포함된 customized video는 생성하지 못한다는 점이다. 저자들은 multi-person video generation을 위한 reward mechanism을 미래 작업으로 제안한다.
저자가 명시하지 않은, 추정되는 한계
- face-centric reward라 의상, 체형, 손, 소품 같은 broader identity cue는 약할 수 있다.
- optical-flow dynamic reward는 움직임의 양을 보지만, 움직임의 자연스러움이나 task-specific correctness를 충분히 보장하지 않는다.
- 자동 preference score가 잘못되면 모델이 metric을 만족하는 방향으로 reward hacking할 수 있다.
- 긴 비디오에서의 identity drift를 구조적으로 막는 memory/anchor module은 아니다.
- multi-concept, multi-person, object personalization에는 reward와 pair selection을 다시 설계해야 한다.
이 방법이 실패하는 경우를 상상할 수 있나?
Reference image와 prompt가 강하게 충돌하는 경우, 예를 들어 정면 얼굴 reference만 있는데 prompt가 빠른 회전, 강한 occlusion, 헬멧/마스크 착용을 요구하면 ID reward와 dynamic/prompt reward가 서로 충돌할 수 있다.
또한 optical flow가 큰 영상이 dynamic-preferred로 선택되면, 실제로는 카메라 흔들림이나 artifact가 큰 sample을 좋은 motion으로 오판할 수 있다. 이 경우 motion은 커지지만 quality나 identity가 불안정해질 수 있다.
| 여러 사람이 등장하는 영상에서는 Face Similarity score를 어느 사람에게 적용할지 assignment 문제가 생긴다. 이 부분은 [[MovieWeaverTuningFree | Movie Weaver]]의 anchored prompt나 subject-level tracking reward와 결합해야 할 가능성이 크다. |
관련될 수 있는 개념/질문 (후보 제안, 질문 형태로)
- Personalized video generation은 reconstruction 문제인가, preference alignment 문제인가?
- ID consistency와 dynamic degree가 충돌할 때 어떤 Pareto frontier를 선택해야 하는가?
- Optical flow 기반 dynamic reward가 flickering과 자연스러운 motion을 구분할 수 있는가?
- Single-person MagicID를 multi-concept personalization으로 확장하려면 subject별 reward를 어떻게 정의해야 하는가?
- Long video identity drift를 reward만으로 줄일 수 있는가, 아니면 temporal memory 구조가 필요한가?
