기본 콘텐츠로 건너뛰기

라벨이 스테이블디퓨전인 게시물 표시

스테이블 디퓨전 Prompt 사례 - Pony 모델

 스테이블 디퓨전으로 이미지 생성시 가장 중요한 요소는 첫번째는 Checkpoint 이고 그 다음이 Prompt 라고 생각한다. prompt 는 checkpoint 에 따라 잘 반응하는 명령어가 있고 어떤 것은 별로 반응하지 않기 때문에 checkpoint 에 따라 prompt 를 적용하여 많은 이미지를 생성해 보아야 알 수 있다. 이 글에서는 Pony 모델에서 여러가지 이미지에 따른 prompt 를 설명하고 싶다. checkpoint : littleoctopusmixMF_v20 를 사용하여 최종 prompt 로 만든 이미지 1. 기본 prompt 구조 (masterpiece), best quality, highres, (detailed:1.2), (sensual lighting), (provocative art), <캐릭터 묘사 (더 자세하게)>, <의상>,<행동/포즈 묘사 >, <배경 묘사>, <분위기/스타일 묘사>, <추가 퀄리티 태그> 약간 섹시한 이미지를 만드는 프롬프트 기본 구조이다. 2. 캐릭터 묘사 alluring young woman : 개략적인 케릭터 설명 flawless porcelain skin : 피부 long dark eyelashes : 긴 속눈썹 small delicate nose : 작고 섬세한 코 soft rosebud lips : 부드러운 장미색 입술 Messy bun , Curtain bangs : 헝클어진 머리, 앞 머리  Prompt : (masterpiece), best quality, highres, (detailed:1.2), (sensual lighting), (provocative art), alluring young woman, flawless porcelain skin, long dark eyelashes, small delicate nose, soft rosebud lips, Messy bun , Curtain bang...

Pony 모델 사용 다양한 스타일 만들기 - Image to Image 로 지브리 스타일 만들기

 스테이블 디퓨전(Stable Diffusion)에서 Pony 모델 은 말 그대로 "포니 스타일"의 그림을 생성하는 데 특화된 커스텀 모델 입니다. 쉽게 설명하면 귀엽고 애니메이션 케릭터를 만드는데 탁월한 모델이다. Pony 모델의 또 하나의 장점은 인체의 다양한 포즈를 구체적으로 아주 잘 만들어 준다. Flux 모델로는 어려운 포즈 일지라도 Pony 모델을 사용하여 이미지를 만들면 인체의 포즈를 아주 잘 표현해 준다. 그리고 애니 케릭터이지만 실사에 가깝게 야한(?) 19금 이미지를 아주 잘 만들어 주기도 한다. Pony 모델로 만든 이미지 이런 Pony 모델을 사용하여 Image to Image 를 만들면 실사 사진을 다양한 스타일의 애니메이션 이미지로 만들 수있다. 이제 Comfyui 를 이용하여 Image to Image 를 만들어보자. 1. Image to Image 를 위한 순서 기본적인 Pony 모델을 사용하여 이미지를 만들 workflow 를 구성한다. 빈 latent 이미지를 사용하는 대신 실사 사진을 적합한 크기로 이미지의 크기를 변경한 후,  VAE Encorder 를 거쳐 latent Image 로 사용한다. 원본 사진과 비숫한 구도를 만들기 위하여 Control net 기능을 추가한다. Pos. prompt 는 가급적 실사 이미지에 적합한 prompt 를 사용하면 좋기 때문에 Image to text 를 추출하기 위하여 Florence2Run   노드를 사용한다. K-sampler 의 Denoise 값을 0.5~0.8 정도에서 변경하면서 원하는 이미지를 만든다. 필요하면 다양한 스타일의 이미지를 얻기 위하여 Lora 모델도 사용한다. 2. 완성된 Workflow Workflow 원본 이미지  이것도 생성된 이미지인데 가상의 실사 사진으로 생각하고 적용시킴 지브리 스타일의 Lora를 사용하여 만든 이미지 지브리 스타일 이미지 그러나 지브리 스타일로 보기에는 뭔가 부족하거나 다르다. 그것은 checkpoin...

Flux Controlnet 적용 방법 - Comfyui 에서 사용

Flux에서도 이제 Controlnet 기능을 사용할 수있다. Comfyui 에서 Stable Diffusion 과 같은 방식으로 사용 할 수 있는  controlnet 모델들이 출시 되었다. 1. Controlnet 이란 ?      ControlNet은 Stable Diffusion 과 같은 이미지 생성 모델에서 조건부 입력 을 추가하여 결과 이미지를 더 세밀하게 제어할 수 있게 한다. 예를 들어, 포즈 , 스케치 , 엣지 지도(edge map) 등을 입력으로 받아 생성된 이미지를 밑그림으로 이미지에 반영할 수 있다.  2. Flux용 Controlnet 모델     Stable Diffusion 용 Controlnet 모델들은 Canny, Depth, Hed, Scribble, Open Pose, Sketch 등 여러가지 모델들이 있는데 Flux 용 모델들은 그 중에서 Canny, Depth, Hed 3가지 종류의 모델들만 출시되었다. 각각의 적용하는 대상은 어떤 이미지를 생성 하는가에 따라 적합한 것을 사용하면 되는데 3가지 모델들이 서로 다른 듯 비슷한 기능들이 섞여 있어서 많은 시행을 해 본 후 더 적합한 모델들을 사용하기를 권한다. 3. Controlnet 적용 기본     Controlnet 의 적용은 먼저 원본 이미지가 필요하고 그것을 Controlnet 모델들이 인식할 수 있도록 바꾸어 주는 전처리기를 통과한 후 Controlnet 모델들을 선택하여 이  이미지를 적용하여 Sampler에 입력한다. 이를 간단하게 workflow 를 구성하면 다음과 같다. 기본 Controlnet Workflow 전처리기는 Controlnet 모델별로 각각 다른 전처리기를 사용하기 때문에 항상 모델에 맞는 전처리기를 사용하여야 올바른 이미지를 얻을 수 있다. 4. Controlnet 모델 과 필수Nod 다운로드 및 설치     다운로드는 huggingf...

FLUX 의 다른 버전 GGUF 사용법 - Comfyui 를 이용한 사용

 Flux는 성능이 뛰어난 이미지 생성형 AI이다. 다만 flux 모델의 크기가 flux1-dev 버전인 경우 대략 22G정도 된다.  크기가 크기 때문에 보통의 데스크탑에서는 사실상 돌리기가 어렵다.  그래서 Flux1-dev-fp8 (대략 11G) 처럼 경량화된 버전들이 출시되어 사용되고 있지만 그래도 역시 이미지 한장 뽑는데 30초이상의 시간이 걸린다. 이 글에서 소개할 Flux-GGUF (약 12G) 버전은 크기도 절반이면서 Flux1-dev-fp8 보다 더 적은 시간으로 이미지를 만들어 준다.  1. Flux-GGUF 모델의 특징 및 장점     1-1.  저장공간 및 VRAM 절약 : GGUF 양자화 모델은 원래 모델에 비해 훨씬 적은 VRAM을 사용하면서도 성능은 비슷하다.  예를 들어, GGUF Q8 모델은 VRAM 사용량을 절반으로 줄이면서도 원본 모델과 99% 유사한 품질을 제공한다​.     1-2.  낮은 사양에서도 실행 가능 : GGUF 모델은 양자화를 통해 모델 크기를 줄였기 때문에, GPU 메모리가 부족한 하드웨어에서 실행할 수 있다. 6GB~12GB VRAM을 가진 장비에서도 원활하게 사용할 수 있어, 고성능 GPU가 없는 사용자에게 유리하다.     1-3.  속도 향상 : GGUF 모델은 이미지 생성 속도도 빠르다.  특히 Q8과 같은 고비트 모델은 일반적인 모델보다 빠르게 처리할 수 있다.     1-4.  호환성 : ComfyUI 및 Forge와 같은 주요 인터페이스에서 GGUF 모델을 지원하므로, 여러 플랫폼에서 쉽게 사용할 수 있다. ​ Flux-GGUF 이미지 ...

인물사진 옷 갈아입기 - Cimfyui 를 이용한 의상교체

 인물사진에서 간단하게 여러가지 옷들을 갈아 입혀보고 싶다 내 사진이든 다른 인물사진 이든 혹은 의류 판매를 위한 모델에 여러가지 의상을 교체해서 입혀보고 싶을때 사용하기 쉬운 comfyui 를 이용한 의상교체하는 방법을 설명한다. 1. ComfyUI 란 ?      AI 기반 이미지 생성과 편집을 도와주는 직관적인 사용자 인터페이스이다.  주로 Stable Diffusion 모델을 활용하여 텍스트로부터 이미지를 생성하거나, 기존 이미지에 다양한 변화를 적용할 수 있다.  ComfyUI는 노드 기반의 시스템으로, 다양한 작업을 시각적으로 구성하고 처리 과정을 조정할 수 있어 창의적 이미지 작업에 매우 유용한 도구이다.  이 도구는 사용자 친화적인 UI와 높은 유연성을 제공하여 초보자도 쉽게 사용할 수 있게 한다.  몇가지 노드를 배열하여 쉽게 의상 교체를 할 수있다. 2. Workflow 구성을 위한 필수 Nodes SegmentAnythingUltra V2     이 노드의 역할은 image 로 부터 교체하고 싶은 의상 부위를 선택하여 masking 한다. CatVTON Wrapper      이 노드가 실제 인물사진의 원하는 부위에 의상을 교체하는 작업을 한다. 위의 두가지 노드들이 설치가 안되어 있으면 comfyui manager 를 통하여 설치하면 된다. 3. Workflow 구성 Workflow     노드 구성은 단순하다.  인물사진 과 의상 이미지를 입력받아서 인물사진의 의상교체부위을 masking 한 후 의상이미지로 바꾸어 인물사진을 생성해 준다. SegmentAnything node의 prompt 입력란에 "upper shirt" 라고 명시해 주면 인물사진에서 상의 부분을 masking 처리해 준다.   경우에 따라 입력 prompt를 수정하여서 원하는 부위가 반드시 masking 되어야...

LoRA 의 뜻과 사용법 - comfyui 에서 사용법

 LoRA(Low-Rank Adaptation)는 딥러닝 모델의 학습을 최적화하고 경량화하는 기술로, 주로 Stable Diffusion과 같은 대형 모델을 커스터마이징할 때 사용된다.      스테이블디퓨전의 checkpoint 는 보통 6G 이상이고,  Flux1-dev 모델은 22G 정도 되는 대형 모델들이다.  이런 대형 모델들을 사용하면서 자신이 원하는 이미지를 만드는데 부족한 부분을 느낄 수있고 checkpoint 전체를 재 training 시키기 보다는 적은 용량으로 모델을 훈련시켜 보완적인 모델로 사용한다.  그런 소형 모델들을 Lora 라고 하며 checkpoint에 연결하여 사용한다. LoRA의 특징 경량화된 학습 : LoRA는 기존 대형 모델의 전체 파라미터를 모두 조정하지 않고, 특정 부분의 더 적은 파라미터만 조정한다. 이는 GPU 메모리를 적게 사용하게 만들어 학습 속도를 크게 높여준다. 빠른 Fine-tuning : LoRA는 대형 모델을 처음부터 다시 학습할 필요 없이, 기존 모델의 특정 요소를 개선하거나 변형할 때 유용하다.  특정 스타일의 이미지로 학습시키려면 LoRA를 사용하여 빠르게 그 스타일에 적합한 모델을 만들어 스타일을 적용 할 수 있다. 유연성하다 : LoRA는 원본 모델(checkpoint)을 손상시키지 않으면서도, 다양한 특성이나 새로운 스타일을 학습시킬 수 있기 때문에 매우 유연하다. 원본 모델과 LoRA 모델을 결합하여 사용하며, 기존 학습된 데이터를 기반으로 모델의 특성을 손쉽게 변경할 수 있다.  특히 특정 인물이나 특정 style 등을 훈련시켜 많이 사용한다. LoRA 사용법 (comfyui)     automatic1111 에서도 물론 LoRA를 사용 할 수 있지만  이 글에서는 comfyui 에서의 LoRA 적용법을 설명한다. LoRA 모델 다운로드 : LoRA 모델들을 다운로드 할 수 있는 사이트...

Flux 사용방법

Flux는 이미지 생성형 AI 이다.      텍스트를 입력하여 이미지를 만드는 이미지 생성AI 는 미드저니, 스테이블디퓨전, Dall-e 등 이렇게 있는데 거기에 새로운 오픈형 생성AI 모델이 출시 되었다.  독일에 본사를 둔  스타트업 Black Forest Labs  에서 개발하였다.  주로 연구진이 스테이블 디퓨전을 개발한 사람들이 만들었기 때문에 스테이블디퓨전 버전업 정도로 이해가 된다.   Flux로 만든 이미지      미드저니 보다 좋다고 여기저기서 말 하길래 직접 다운로드 하여 사용해 본다.      Flux 모델도 comfyui 로 사용 할 수있다고 하니 comfyui 를 이용하여 사용해 본다. 1. Flux 모델 다운로드      Flux 모델은 3가지가 있다. Flux.1 [pro]  : 상업용 모델로 직접 로컬 컴터에서는 사용이  안되고 지원하는 클라우드서버(fal.ai)를 통해서 사용이 가능하다. Flux.1 [dev]  : 비 상업용으로 연구 목적을 위하여 사용이 가능하다. Flux.1 [schnell] : 개인들이 로컬 컴퓨터로 역시 비 상업용 용도로 사용하는데 속도가 빠르다는 모델이다.      이중에서 Flux.1 [dev] 를 다운로드 한다.       좀 더 빨리 이미지를 생성하고 싶으면 Flux.1 [schnell] 을 다운받아 사용하면 된다.      Hugging Face 에서 다운로드.  https://huggingface.co/black-forest-labs/FLUX.1-dev/tree/main Hugging Face 의 Flux 모델 다운로드받는곳      여기서  flux1-dev.safetensors (2...

Prompt 작성법 및 사용예

Prompt 란 일종의 AI에게 지시하는 명령어 이다.      Stable Diffusion은 텍스트 기반의 이미지 생성 모델로, 사용자가 입력한 프롬프트(prompt)에 따라 다양한 스타일의 이미지를 생성할 수 한다. 프롬프트는 모델이 어떤 이미지를 생성할지 지시하는 중요한 명령어다. 따라서, 효과적인 프롬프트 작성 방법을 이해하는 것은 Stable Diffusion을 잘 활용하기 위한 필수적인 단계이다. 이 글에서는 프롬프트 작성 시 고려해야 할 요소와 몇 가지 예시를 통해 그 사용 방법을 설명한다. 1. 영어로 명확하고 구체적으로 작성(Positive prompts)      프롬프트는 모델이 생성할 이미지를 구체적으로 묘사하는 텍스트이다. 짧고 모호한 프롬프트는 원하는 결과를 얻기 어렵다. 예를 들어, 단순히 "landscape"이라고 입력하면 매우 다양한 스타일의 풍경이미지가 나온다. 반면에 "Green fields with sunlight, blue sky, and mountains in the distance"이라는 프롬프트는 훨씬 더 구체적이고 원하는 이미지를 얻을 수있다.  그리고 아쉽게도 반드시 영어로 작성 해 주어야 한다.       프롬프트에는 다음과 같은 세부 사항을 포함하는 것이 좋다. 주제(subject)  : 가장 중요하며 맨 처음에 입력하기를 권한다.  'a beautiful woman' , 'a body builder', 'a cute baby' 등 이미지 종류 : 'picture', 'drawing', 'painting' 등 스타일 : 주제에 대한 스타일  'slim body' ,'red lips', 'smile' , 'wearing white t-shirt and jean' 등 장소 또는 배경  : ' in room', 'c...