레퍼런스 이미지 AI 생성은 텍스트 프롬프트만으로는 잡기 어려운 스타일·구도·인물 특징을 기존 이미지에서 가져오는 방식입니다. 같은 “참조”라도 무엇을 참조할지에 따라 사용하는 기능이 다릅니다. 이 글은 세 가지 참조 방식의 차이와 각 도구의 공식 지원 범위를 정리합니다.
세 갈래 구분
스타일·구도·인물 참조는 어떻게 다른가요?
세 가지 참조는 “이미지에서 무엇을 빌려올지”가 다릅니다. 스타일 참조는 색감·질감·붓터치 같은 시각적 분위기만 가져옵니다. 구도 참조는 인물 자세·물체 배치·원근 같은 구조를 가져옵니다. 인물 참조는 얼굴 특징·헤어스타일 같은 정체성을 유지합니다.

| 참조 유형 | 가져오는 것 | 대표 기능 |
|---|---|---|
| 스타일 | 색·질감·분위기 | Midjourney --sref, SD IP-Adapter |
| 구도 | 자세·배치·원근 | ControlNet(OpenPose·Canny·Depth) |
| 인물 | 얼굴·정체성 | Midjourney --cref, InstantID |
혼동을 피하려면 “원본의 어떤 요소를 유지할지”를 먼저 정하는 편이 좋습니다.
Midjourney 방식
Midjourney에서는 어떻게 쓰나요?
Midjourney는 스타일과 캐릭터 참조를 별도 파라미터로 분리해서 제공합니다. 프롬프트 끝에 이미지 URL과 함께 --sref(Style Reference) 또는 --cref(Character Reference)를 붙이는 방식입니다. Midjourney 공식 문서에 따르면 --sw(style weight)로 스타일 반영 강도를, --cw(character weight)로 캐릭터 유사도를 조절할 수 있습니다.
기본 사용 예시는 다음과 같습니다.
- 스타일 참조:
프롬프트 --sref [이미지URL] --sw 100 - 캐릭터 참조:
프롬프트 --cref [이미지URL] --cw 100
--sw는 0~1000 범위, --cw는 0~100 범위입니다. 값이 클수록 원본을 더 강하게 따라갑니다. 다만 Midjourney의 캐릭터 참조는 “AI가 생성한 캐릭터”에 최적화되어 있고, 실제 사진 인물 재현은 완벽하지 않다는 점이 공식적으로 명시돼 있습니다.
구도 통제
구도·자세를 정확히 잡으려면 무엇을 쓰나요?
구도·자세를 픽셀 단위로 통제하려면 Stable Diffusion 계열의 ControlNet이 사실상 표준입니다. ControlNet은 원본 이미지에서 특정 정보(윤곽·자세·깊이 등)만 뽑아 새 이미지에 강제하는 방식입니다.

주요 프리프로세서는 다음과 같습니다.
- OpenPose: 사람의 뼈대·자세 추출
- Canny: 윤곽선 추출
- Depth: 원근·깊이 정보 추출
- Scribble: 대충 그린 스케치 반영
ControlNet은 오픈소스이며, ComfyUI·A1111 WebUI 등에서 무료로 사용 가능합니다. 다만 로컬 GPU(최소 VRAM 6~8GB 권장)나 유료 클라우드 실행 환경이 필요합니다. Midjourney의 --sref·--cref처럼 클릭 한 번으로 되는 방식은 아니라는 점이 진입장벽입니다.
인물 재현
특정 인물의 얼굴을 유지하려면요?
특정 얼굴을 반복 재현하려면 캐릭터 참조 또는 얼굴 임베딩 전용 도구가 필요합니다. Midjourney --cref 외에 InstantID·IP-Adapter FaceID(오픈소스) 같은 방식이 있습니다. InstantID는 단 한 장의 사진만으로 얼굴 특징을 임베딩해 다양한 구도·스타일에 적용할 수 있도록 설계된 기법입니다.
주의할 점은 두 가지입니다.
- 실존 인물(연예인·정치인 등) 사진을 참조하는 것은 대부분 서비스 약관에서 제한합니다.
- 본인 사진이라도 결과물의 상업적 사용은 각 서비스 라이선스를 따라야 합니다.
특히 딥페이크로 오인될 수 있는 결과물은 법적 리스크가 있으므로 이용 전 각 도구의 정책 페이지를 확인해야 합니다.
한계와 트레이드오프
어떤 상황에서는 오히려 부적합한가요?
레퍼런스 이미지 AI 생성은 만능이 아닙니다. 다음 상황에서는 효과가 제한적이거나 부적합합니다.
- 정확한 텍스트 삽입이 필요한 경우: 참조 이미지의 글자는 대부분 왜곡됩니다.
- 저작권 있는 캐릭터·IP 재현: 법적 문제와 서비스 약관 위반 소지.
- 의료·법률 도해: 정확도 보장이 없어 실무 자료로 부적합.
- 여러 인물이 동시에 등장하는 장면: 얼굴 일관성 유지가 급격히 어려워짐.
반대로 효과가 뚜렷한 영역은 개인 SNS 이미지, 브랜드 무드보드, 스토리보드 초안, 캐릭터 컨셉 시안 등 “최종 결과물 이전의 아이데이션 단계”입니다. 공식 근거로 확인한 핵심과 한계만 정리합니다.
자주 묻는 질문
Q. 스타일 참조와 이미지 투 이미지는 다른가요?
A. 다릅니다. 이미지 투 이미지는 원본 자체를 변형하고, 스타일 참조는 분위기만 빌립니다.
Q. Midjourney `–cref`로 실제 지인 얼굴 재현이 되나요?
A. 유사도는 낮습니다. 공식적으로 AI 생성 캐릭터 재현에 최적화돼 있습니다.
Q. ControlNet은 무료인가요?
A. 오픈소스로 무료지만 로컬 GPU나 유료 클라우드 실행 환경이 필요합니다.
Q. 참조 이미지 저작권은 어떻게 처리하나요?
A. 본인 촬영·CC0·라이선스 확보 이미지만 사용하는 것이 안전합니다.
Q. 세 방식을 동시에 쓸 수 있나요?
A. ComfyUI에서는 여러 ControlNet과 IP-Adapter 조합이 가능합니다.
레퍼런스 이미지 AI 생성은 참조 유형에 따라 도구가 갈리며, 하나의 도구가 모든 요구를 만족시키지는 못합니다. Midjourney는 접근성이 좋지만 세밀한 구도 통제에 약하고, ControlNet은 정밀하지만 진입장벽이 있습니다. 최종 결과물이 아닌 시안·아이데이션 단계에서 쓸 때 가장 안전하며, 저작권과 서비스 약관을 먼저 확인한 뒤 시작하는 것을 권장합니다.
답글 남기기