Qwen-Image-2.1 사용법: 투명 PNG·다중 이미지 편집과 라이선스 확인

Qwen-Image-2.1은 2026년 9월 20일 공개된 이미지 생성·편집 모델이다. 텍스트로 새 이미지를 만드는 기능과 기존 이미지를 고치는 기능을 하나의 체크포인트에 합쳤고, 투명 배경을 포함한 RGBA 출력과 최대 10장의 참조 이미지 입력을 지원한다. 다만 “오픈 웨이트”라는 표현만 보고 업무에 바로 투입하면 안 된다. 현재 가중치는 Qwen Research License가 적용되며, 연구와 평가 목적의 비상업적 사용만 허용된다.

이 글은 모델의 특징을 나열하는 데서 끝내지 않고, ComfyUI와 Diffusers에서 준비할 파일과 입력 위치, 투명 PNG를 확인하는 방법, 다중 이미지 편집 흐름, 라이선스 때문에 실제 업무에서 멈춰야 하는 지점을 순서대로 정리한다. 기존의 영상·음성 분석 모델이 궁금하다면 Qwen3.8-Omni-Flash 활용 가이드도 함께 볼 수 있다.

핵심부터: 무엇이 달라졌나

  • 하나의 모델로 생성과 편집: 텍스트 투 이미지와 이미지 조건 편집을 같은 QwenImage21Pipeline에서 처리한다.
  • 투명 배경을 모델이 직접 출력: 64채널 RGBA VAE를 사용해 알파 채널이 포함된 이미지를 만들 수 있다. 결과는 PNG처럼 알파 채널을 보존하는 형식으로 저장해야 한다.
  • 최대 10장 참조: 인물, 제품, 의상, 배경, 스타일 자료를 여러 장 넣어 한 장면으로 조합하거나 편집할 수 있다.
  • 부분 수정 지시: 원, 칠한 표시, 별도 마스크로 고칠 영역을 지정할 수 있다.
  • 기본 2K 출력: 공식 Diffusers 예제는 2048×2048과 여러 가로세로 비율을 제시하며, 기본 추론 단계는 40회다.
작업기존에 흔한 흐름Qwen-Image-2.1 흐름확인할 점
투명 소재생성 후 배경 제거·매팅RGBA 출력을 직접 요청알파 채널과 가장자리 품질을 별도 확인
여러 자료 조합콜라주 제작 후 다시 생성최대 10장 참조 이미지를 입력각 참조의 역할을 프롬프트에 명시
부분 수정마스크 전용 모델이나 별도 앱 사용표시·마스크와 자연어 지시를 함께 사용수정하지 않을 요소도 보존 조건으로 적기
업무 배포서비스 약관에 따라 사용현재 연구·평가용으로 제한상업적 사용은 별도 라이선스 필요
여러 참조 이미지와 부분 수정 표시를 결합해 투명 배경 이미지를 만드는 흐름
참조 이미지, 부분 수정 지시, RGBA 출력을 하나의 편집 흐름으로 연결하는 구조

시작 전에 확인할 네 가지

1. 라이선스가 목적과 맞는가

현재 라이선스에서 Non-Commercial은 연구 또는 평가 목적만을 뜻한다. 자료를 사용해 만든 결과를 광고, 유료 서비스, 고객 납품, 수익화 콘텐츠 제작에 활용하려면 별도의 상업 라이선스를 요청해야 한다. 개인이 쓴다는 이유만으로 자동으로 허용되는 구조가 아니다. 먼저 “기능 검토용 실험인가, 실제 배포물 제작인가”를 구분해야 한다.

2. 저장 공간과 다운로드 시간을 확보했는가

Hugging Face의 공식 전체 저장소 파일 크기는 확인 시점 기준 약 33.1GB다. ComfyUI용 재패키지에서는 확산 모델과 텍스트 인코더의 BF16 또는 INT8 파일 중 필요한 조합을 골라 받을 수 있지만, 작은 앱처럼 가볍게 설치되는 모델은 아니다. 모델 파일 외에도 결과 이미지와 캐시 공간을 남겨 두는 편이 안전하다.

3. GPU 메모리 조건을 추측하지 않았는가

공식 저장소는 특정 GPU를 최소 사양으로 보장하지 않는다. Diffusers는 메모리가 부족할 때 enable_model_cpu_offload()를 제공하지만, 이는 속도 저하 가능성을 감수하고 일부 부담을 CPU로 옮기는 방법이다. “7B이므로 어떤 소비자 GPU에서도 빠르다”처럼 단정하지 말고, 우선 낮은 해상도와 한 장의 참조 이미지로 실행 여부를 확인한다.

4. 참조 이미지 권리가 정리됐는가

여러 장을 입력할 수 있다는 기능과 그 이미지를 사용할 권리는 별개다. 인물 동의, 제품 사진 소유권, 브랜드 자산 사용 범위, 공개 가능한 고객 자료인지 확인한다. 주민등록증, 계약서, 내부 화면처럼 민감한 자료는 로컬 실행 여부와 무관하게 입력하지 않는 편이 안전하다.

ComfyUI에서 설치하는 가장 쉬운 순서

ComfyUI 공식 지원은 출시 당일부터 제공됐다. 아래 순서는 공식 재패키지와 템플릿을 사용하는 방법이다.

  1. ComfyUI 업데이트: 기존 설치를 최신 안정 버전으로 갱신한다. Desktop·Cloud는 안정 릴리스 반영 시점이 다를 수 있으므로 템플릿이 보이지 않으면 업데이트 상태부터 확인한다.
  2. 모델 파일 선택: 처음 확인할 때는 공식 텍스트 투 이미지 템플릿이 기본으로 지정한 qwen_image_2.1_int8_convrot.safetensors, qwen3vl_8b_int8_convrot.safetensors, qwen_image_2.1_vae_bf16.safetensors 조합을 기준으로 시작할 수 있다. 품질·호환성 요구에 따라 BF16 조합을 검토하되, 하드웨어에 맞는지는 직접 확인해야 한다.
  3. 정확한 폴더에 복사: 확산 모델은 ComfyUI/models/diffusion_models/, 텍스트 인코더는 ComfyUI/models/text_encoders/, VAE는 ComfyUI/models/vae/에 둔다.
  4. 공식 템플릿 열기: Templates에서 Qwen-Image-2.1 텍스트 생성 또는 이미지 편집 템플릿을 불러온다. 템플릿이 없다면 공식 workflow_templates 저장소의 JSON을 내려받아 연다.
  5. 입력 확인: 모델 선택 노드에 방금 설치한 세 파일명이 보이는지 확인한다. 편집 작업이면 image_1부터 참조 이미지를 연결하고, 각 이미지의 역할을 프롬프트에 적는다.
  6. 작은 조건으로 첫 실행: 처음부터 2K와 10장 참조를 사용하지 말고 1024×1024, 참조 1장, 고정 seed로 파이프라인이 끝까지 도는지 확인한다.

완료 확인: Queue 실행이 오류 없이 끝나고 Save Image 노드에서 PNG가 저장되며, 일반 이미지 편집기에서 체크무늬 배경 위로 피사체만 보이면 알파 채널이 보존된 것이다. 흰 배경으로 보인다는 사실만으로 투명도가 없다고 판단하지 말고, 알파 채널을 표시하는 편집기에서 확인한다.

투명 이미지를 요청하는 프롬프트

공식 템플릿은 투명 이미지를 만들 때 RGBA와 알파 채널, 투명 배경을 명시하는 문장 구조를 권장한다. 가운데에 만들 피사체 설명을 넣는다.

This is an RGBA format image with transparency.
A folded paper bird sticker with crisp blue edges and a soft shadow.
The image has an alpha channel and a transparent background.

결과는 PNG로 저장한다. JPEG는 알파 채널을 보존하지 않는다. 블로그 썸네일처럼 최종 배경이 정해져 있다면 투명 파일과 배경을 합친 미리보기 파일을 따로 보관하면 가장자리와 색 번짐을 확인하기 쉽다.

Diffusers로 실행하는 위치와 순서

코드로 자동화하려면 터미널에서 별도 가상환경을 만든 뒤 공식 요구 패키지를 설치한다. 현재 저장소는 PyTorch 2.4 이상, Transformers 5.17 이상, GitHub 최신 Diffusers, Accelerate, Pillow를 제시한다.

pip install "torch>=2.4.0"
pip install "transformers>=5.17"
pip install git+https://github.com/huggingface/diffusers
pip install accelerate pillow

그다음 프로젝트 폴더의 파이썬 파일에 아래처럼 파이프라인을 작성한다. 이 예시는 공식 구조를 짧게 정리한 것으로, 실제 성공 속도나 필요한 GPU 메모리를 보장하는 테스트 결과는 아니다.

import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16
).to("cuda")

prompt = (
    "This is an RGBA image with transparency. "
    "A folded paper bird sticker with crisp blue edges. "
    "The image has an alpha channel and a transparent background."
)

image = pipe(
    prompt=prompt,
    width=2048,
    height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("paper-bird.png")

GPU 메모리 부족이 발생하면 파이프라인을 바로 CUDA로 옮기는 대신 pipe.enable_model_cpu_offload()를 사용하고, 해상도·참조 이미지 수·동시 작업 수를 줄인다. 완료 여부는 파일 존재만 보지 말고 이미지 크기, 알파 채널, 피사체 경계, 프롬프트에 적은 보존 조건을 함께 점검한다.

다중 이미지 편집은 역할을 먼저 정한다

참조 이미지를 많이 넣는 것보다 각 이미지가 무엇을 담당하는지 구분하는 것이 중요하다. 예를 들어 “image 1의 인물 얼굴과 머리 모양을 유지하고, image 2의 재킷을 입히며, image 3의 실내 조명 분위기를 사용하되 로고와 글자는 새로 만들지 말라”처럼 역할과 금지 조건을 함께 적는다. 부분 수정에서는 원이나 칠한 표시가 지시하는 영역만 바꾸고 나머지 구도·인물·제품 형태를 보존하라고 명시한다.

한 번에 10장을 모두 넣기보다 2~3장으로 기준 결과를 만들고 한 장씩 추가하는 편이 문제 원인을 찾기 쉽다. 결과가 틀어졌다면 seed를 고정한 상태에서 참조 한 장이나 조건 한 문장만 바꿔 비교한다.

실용적인 활용 예시 세 가지

예시 1. 투명 배경 스티커·아이콘 평가

입력: 피사체 설명, 원하는 재질과 윤곽, RGBA 문구. 진행: 1024px에서 형태를 먼저 확인하고 2K로 올린 뒤 PNG로 저장한다. 검토: 반투명 가장자리, 그림자에 남은 배경색, 작은 구멍 내부의 알파 값을 확인한다. 제약: 현재 라이선스에서는 연구·평가용으로만 다루고, 수익화 페이지나 고객 자산에는 별도 허가 없이 사용하지 않는다.

예시 2. 여러 자료로 콘셉트 보드 구성

입력: 인물·의상·소품·공간 자료와 각각의 역할 설명. 진행: 두 장으로 시작해 구도를 잡고, 제품이나 배경을 한 장씩 추가한다. 산출물: 최종 디자인이 아니라 검토용 콘셉트 보드. 검토: 인물과 제품 형태가 섞이지 않았는지, 원본의 상표·문구가 엉뚱하게 복제되지 않았는지, 공개 권리가 있는 자료만 들어갔는지 확인한다.

예시 3. 표시 기반 부분 수정

입력: 원본 이미지, 수정할 영역을 표시한 사본, “표시 영역만 변경” 조건. 진행: 색상 변경처럼 범위가 작은 작업부터 확인하고 의상·배경 교체로 확장한다. 검토: 수정 영역 밖 얼굴, 손, 제품 비율, 조명이 유지됐는지 비교한다. 제약: 표시가 모호하면 모델이 주변까지 재구성할 수 있으므로 변경 범위와 보존 범위를 모두 적는다.

연구 평가와 상업적 활용 사이에서 별도 라이선스를 확인하는 경계
기능을 시험하는 단계와 실제 상업 배포 단계 사이에는 별도의 라이선스 검토가 필요하다

비용과 성능을 판단할 때 빠지기 쉬운 함정

공식 저장소는 자체 호스팅용 가중치와 실행 코드를 제공하지만, 모든 사용자를 위한 단일 공식 호스팅 가격표를 제시한 것은 아니다. 로컬 실행 비용은 GPU 구매비, 전기, 저장 공간, 대기 시간, 실패한 재생성 횟수까지 포함해 계산해야 한다. 7B라는 숫자는 시각 생성 부분의 크기이며, 전체 다운로드에는 Qwen3-VL 8B 텍스트 인코더와 VAE도 포함된다.

공식 Diffusers 기본값은 2048×2048, 40단계다. ComfyUI 공식 템플릿은 빠른 첫 확인을 위해 1024×1024, 25단계로 시작한다. 두 설정의 목적이 다르므로 한쪽 결과만 보고 모델 전체 품질을 단정하지 않는다. 속도·메모리·품질을 비교하려면 같은 seed, 같은 참조 이미지, 같은 해상도에서 설정 하나씩만 바꾼다.

자주 막히는 문제와 해결 순서

  • 템플릿에 모델이 안 보임: ComfyUI 업데이트 → 파일명 확인 → 세 하위 폴더 위치 확인 → 재시작 순서로 점검한다.
  • CUDA 메모리 부족: 1024px로 낮추기 → 참조 수 줄이기 → 배치 1 확인 → CPU offload 또는 INT8 조합 검토 순서로 대응한다.
  • 투명 PNG가 흰색으로 보임: JPEG 저장 여부 → PNG 알파 채널 → 편집기의 투명도 표시 기능 → 프롬프트의 RGBA 문구를 확인한다.
  • 참조 대상이 섞임: 이미지별 역할을 문장으로 분리하고, 2장부터 다시 시작하며, 고정 seed로 한 조건씩 추가한다.
  • 일부만 고치려 했는데 전체가 변함: 표시 영역을 더 명확히 만들고 “나머지 구도·얼굴·제품 형태를 유지” 조건을 추가한다.
  • 사용 가능 범위가 불명확함: 결과를 공개·판매하지 말고 라이선스 원문과 별도 상업 라이선스 절차를 먼저 확인한다.

누가 지금 써보고, 누가 기다려야 하나

로컬 이미지 모델을 평가하는 연구자, ComfyUI 워크플로를 실험하는 개발자, 투명 출력과 다중 참조 편집의 가능성을 비상업적으로 검토하려는 팀에는 살펴볼 가치가 있다. 특히 배경 제거를 별도 단계로 두지 않고 알파 채널을 직접 만드는 흐름은 명확한 차별점이다.

반대로 광고 소재, 쇼핑몰 이미지, 유료 콘텐츠, 고객 납품물을 곧바로 만들 사람은 현재 가중치를 먼저 설치하기보다 라이선스부터 해결해야 한다. GPU와 저장 공간이 빠듯한 사용자도 공식 데모나 관리형 지원 상태를 확인한 뒤 판단하는 편이 낫다. 핵심은 “다운로드할 수 있다”와 “내 목적에 사용할 수 있다”를 분리하는 것이다.

공식 자료

자료 확인일: 2026년 9월 21일

댓글

이 블로그의 인기 게시물

Diagram Design 사용법: Claude Code·Codex로 다이어그램 만드는 순서

OpenAI Agents API란? 관리형 에이전트 실행 환경 이해하기

Aside Browser 사용법: 설치·가격·권한과 업무 자동화 가이드