기본 콘텐츠로 건너뛰기

글

라벨이 이미지 생성 AI인 게시물 표시

Hidream-O1 이미지생성 AI 모델, 이미지 편집 모델

Hidream-O1  이미지생성 AI 모델에 대하여 사용해 본다. HiDream-O1-Image 는 HiDream.ai에서 공개한 오픈소스 기반의 차세대 이미지 생성 파운데이션 모델이다.  보통 기존 이미지 생성형 모델들은 생성모델(checkpoint), VAE, 텍스트 인코더(CLIP 등) 이 별도로 존재하여 사용했는데, 이 모델은 3가지 기능의 모델이 한 파일에 모두 합쳐져 되어있다. Hidream-O1 1. 주요 특징 독보적인 텍스트 렌더링 (Text-on-Image): 이미지 내에 길거나 복잡한 문장, 다국어(영어·중국어 등) 텍스트를 왜곡 없이 정확하게 배치해 준다. 포스터 디자인이나 타이포그래피 작업에서 현존 오픈소스 모델 중 최상위권의 성능을 낸다. One Model, Many Tasks (하나의 모델, 다양한 작업) : 텍스트에서 이미지 생성 뿐 아니라 이미지 에서 이미지 편집도 가능한 통합된 모델이다. Reasoning-Driven Prompt Agent (추론 기반 프롬프트 에이전트) : 이미지를 그리기 전에 "어떤 구도로 배치하고, 글자는 어디에 넣어야 자연스러울지" 먼저 스스로 논리적으로 추론하고 계획을 세우는 단계를 거칩니다. 덕분에 사용자가 대충 말해도 찰떡같이 이해하고 정확한 결과물을 낸다.\ Native High Resolution (네이티브 고해상도) : 업스케일 작업없이 2048x2048 이미지를 생성한다. 2. Hidream-O1  모델 설치 및 사용     이 모델을 최신 Comfyui 가 업데이트 되어 있다면  Workflow Template 에서 Hidream-O1 Full 을 선택하면 그곳에 모델과 text_encorder 를 바로 다운받을 수 있다. Hidream-O1 : ../comfyui/models/checkpoints  폴더에 설치 gemma4_e4b_it_fp8_scaled : ../comfyui/models/clip 폴더에 설치 3. 텍...

Flux2 에 대한 소개 - Flux2-dev

Flux2 가 출시 되었다.  Flux는 독일의 AI 연구소인 Black Forest Labs 에서 개발한 최신 인공지능 이미지 생성 모델인데 Flux2 는 편집도 가능한 모델이 다.  Stable Diffusion SDXL 버전을 사용하는 중에 출시된 Flux 모델을 사용해 보고 Flux 의 이미지 품질에 푹 빠졌었는데 이번에 Flux2 가 출시된 것이다.  요즈음  QWEN-Image-Edit-2509 모델과 나노 바나나 프로 3 등등  이미지 편집에 획기적인 변화가 몰려오고 있는 와중에 Flux2 또한 여기에 함께 한 듯하다. Flux2-dev-gguf 모델로 만든 인포그래픽 이미지 1. Flux2 의 특장점 및 단점 고품질 및 고해상도 출력 (최대 4MP ) 이 가능하다.  사실적인 디테일과 현실과 같은 이미지를 만들어 준다.  복잡한 텍스트를 처리하여 상당히 정확하게 잘 표현해 준다.  디자인 분야에 나노바나나 프로 처럼 매우 유용하게 사용될 수 있다. 다중참조 이미지(10 정도 까지)를 입력하여 원하는 이미지로 블렌딩 할 수있다. 다중언어 지원이 가능하기 때문에 한글로 프롬프트를 입력해도 이미지를 생성 할 수 있다. 다만 오픈 소스 모델로 로컬 컴퓨터에서 사용하기에는 상당한 고성능이 필요하다.   내 컴퓨터 (4070ti 16G) 그래픽 카드에서도 832 x 1536 한장 생성하는데 300초 정도가 소요된다. 오픈 모델 Flux2 [dev] 권장 VRAM 이 24G 이상이다. (지금은 포기가 건강에 좋을듯 하다. ㅜㅜ) 2. Flux2 모델 종류 Flux2 [pro] : 최고급 품질의 폐쇄형 상위 모델. 빠르고 저렴한 이미지 생성 지원하며 API 를 통하여 사용가능하다. Flux2 [dev] : 320억 매개변수를 가진 오픈 웨이트 모델 . 텍스트-이미지 생성 및 다중 입력 이미지 편집 기능이 가능하다.  Flux2 [Flex] : 개발...

한글 Prompt 사용 - QWEN 이미지 생성 AI

Prompt(프롬프트) 란 이미지 생성을 지시하는 요구 조건들의 명령어 이다. 보통 프롬프트는 영어로 작성을 하여 사용한다. Stable Diffusion, Flux, QWEN, Hidream, Midjourney , Wan 등등  모든 이미지 생성용 모델들은 영어로 작성하여 사용하면 된다. 한글은 인식을 못한다.  다만 QWEN 은 한글 프롬프트도 잘 해석해서 만들어준다.  그리고 동영상 제작 모델인 Wan 모델도 상당히 한글 프롬프트를 해석해서 만들어준다.  QWEN 모델은 중국 알리바바에서 만든 모델이여서 인지 한자 뿐만 아니라 한글도 인식을 잘 한다. 여기서는 QWEN을 이용하여 한글 프롬프트를 사용하여 본다. QWEN모델로 한글 프롬프트를 입력하여 만든 이미지 1. QWEN 모델 사용을 위한 Workflow     Comfyui 에 보면 browses 에 QWEN 용 workflow template 이 있기 때문에 불러서 사용한다.    QWEN text to image workflow Template 에서 QWEN 이미지 생성용 workflow 를 불러오면 거기에는 필요한 모델들의 링크주소가 있기 때문에 쉽게 다운받아 적용할 수있다. 2. 각 모델과 사용조건 Checkpoint : qwen_image_fp8_e4m3fn CLIP Model : qwen_2.5_vl_7b_fp8_scaled VAE Model : qwen_image_vae Lora Model : Qwen-Image-Lightning-8steps-v1.0 Sampler : res_2s (없으면 euler) Scheduler : bong_tangent (없으면 simple) steps : 8 steps cfg : 1.0 3. 간단한 prompt 를 입력하고 실행     Prompt :  A beautiful woman, wearing a tight-fitting red dress, a red l...

Flux-krea-dev 이미지 생성 모델 - Flux-dev 모델과 차이

Flux1-krea-dev는 Black Forest Labs와 Krea AI가 협력하여 개발한 최신 오픈소스 텍스트-이미지 생성 AI 모델이다.   이 모델은 기존 AI 이미지에서 흔히 발견되는 부자연스러운 인공미를 제거하고, 뛰어난 사실감과 미적 품질을 제공하는 것을 목표로 만들어 졌다. Flux1-dev 모델로 이미지를 생성해 보면 매우 뛰어난 화질에 매료된다.  하지만 인물의 피부 질감이나 이미지의 색감이 인공미가 많이 느껴지는 것도 사실이다. 그래서 이러한 인공미를 최대한 자연스러운 사실감으로 생성될 수 있는 모델이 Flux1-krea-dev 이다. Flux1-krea-dev 모델로 생성 Flux1-dev 모델 이미지 사용된 Prompt : Graphite sketch of a beautiful woman, animation style, flat composition, face upward, ((happy smile:1.4)), sitting , cross legs, glossy ruby red lips. She wears an elegant sheer white midi dress designed with a sophisticated and artistic floral motif, prominently showcasing large roses and delicate vine patterns in shades of deep pink and purple. The dress features sheer sleeves, a body-hugging silhouette, and intricate, sparkling embellishments with an artistic arrangement of flowers cascading down one side. The background sets an elegant and atmospheric scene: Vintage-style classic café – Warm, ambient lightin...

HiDream AI model - 오픈 소스 이미지 생성모델

 HiDream-I1은 HiDream.ai 팀(중국)에서 2025년 4월에 공개한 새로운 오픈소스 이미지 생성 모델이 다. 최근에 stable diffusion 이나 Flux 와 비슷한 오픈소스 이미지 생성 모델이 출시가 되어 comfyui 를 통하여 한번 사용해 보았다. HiDream AI 1. 주요특징 오픈소스: 누구나 자유롭게 사용하고 연구할 수 있다. 고성능: 170억 개의 파라미터를 가지고 있어, 몇 초 안에 높은 수준의 고품질 이미지를 생성할 수 있다. 다양한 스타일: 텍스트 프롬프트를 기반으로 사진, 만화, 예술 등 다양한 스타일의 이미지를 생성할 수 있다. hidream_e1_full_bf16.safetensors  이나  hidream_i1_dev_bf16.safetensors  모델은 크기가 34G 정도로 크기 때문에 VRAM 27G 이상으로 16G 이하에서는 사용이 어렵다. hidream_i1_dev_fp8.safetensors  모델은 16G 이하에서 사용이 가능하지만 역시 flux 보다 생성 속도는 느리다.   상업적 이용 가능: MIT 라이선스를 따르므로 개인 프로젝트, 과학 연구, 상업적 용도로 생성된 이미지를 자유롭게 사용할 수 있다. QuadrupleCLIPLoader 를 사용하기 때문에 4개의 CLIP 모델이 필요하다. 2. CLIP 모델, Diffusion 모델 및 VAE download Comfyui 를 이용하여 HiDream 모델을 사용하기 위해서는 가장 최신의 comfyui 로 업데이트를 먼저하고  다음 사이트에서 순서대로 다운받아 정해진 폴더에 저장하면 된다. workflow 역시 다운받아 사용할 수있다. 해당 사이트는 구글에서 "comfyui hidream" 으로 검색해도 알 수있다.  ( https://comfyanonymous.github.io/ComfyUI_examples/hidream/ ) 3. Workflo...

스테이블 디퓨전 3.5 large 모델 - Stable Diffusion 3.5 Large 모델 다운 및 사용

 스테이블 디퓨전 3.5 Large 모델이 출시 되었다. Stable Diffusion 3.5 Large 및 Stable Diffusion 3.5 Large Turbo를 포함하여 출시 되었으며. Stable Diffusion 3.5 Medium은 10월 29일에 출시 예정이라고 한다. 그리고 출시되는 모델 모두 상업적, 비상업적 사용 모두 무료 로 제공된다고 한다. 사실 SD3.0 버전은 기대에 못 미치는 모델로 평가되어 비판을 많이 받았던 모델이다. 저 또한 SD3.0 을 잠깐 사용해 보았는데 차라리 SDXL 버전을 사용하는 것이 더 좋았기 때문에 테스트 후 사용해 보지 않았다.   이번에는 Stability AI 사 에서 야심차게 준비해서 출시 하였다고 하니 한번 사용해 보자. Release Stable Diffusion 3.5 1. Stable Diffusion 3.5 Large 다운로드 및 설치 CIVITAI 사이트 에 접속 Stable Diffusion 3.5 로 검색하면 모델이 나온다. Large 모델 (15.xx G)을 다운 받는다. 물론 Large Turbo 모델을 다운받아 사용해도 된다. 다운받은 파일은 ( ..\comfyui\models\checkpoints ) 폴더에 설치 하면 된다. 2. clip_g.safetensors 다운로드 및 설치 clip_g.safetensors 다운로드 :  https://huggingface.co/Comfy-Org/stable-diffusion-3.5-fp8/blob/main/text_encoders/clip_g.safetensors 만약 Flux 를 사용해 본적이 없다면 아래 두개의 clip 모델도 다운 받아 설치 해야된다. clip_l.safetensors 다운로드 :  https://huggingface.co/comfyanonymous/flux_text_encoders/blob/main/clip_l.safetensors t5xxl_fp16.safetens...