ai 图片模子微调:ams.8abg8.net从3张猫图到波动出片的LoRA锻炼条记

2026-10-09 05:04:42 • 研发实力 • 阅读 78

拿三张自家猫图片图ams.8abg8.net的照片塞进Stable Diffusion做ai 图片模子微调,出来的猫尽是正嘴斜眼。那不是模子笨,是数据量根柢不够模微。微调图片模子有一条硬门槛,统一主体至少筹办20张,最好50张。

角度、光照、背景都得有革新了。我试过只给10张,调从的LA锻锻炼loss降到0.02,生成图却像融化的塑料。先把素材裁成512×512或1024×1024了,用BLIP主动打标。再手动删掉“cat”“white”那类通用词。标签要留存独占特征,好比“蓝色项圈”“左耳缺角”张猫的。否则模子会把项圈当成所有猫的标配。那一步偷懒,后面ai 图片模子微调就会把背景里的沙发、地毯全教进去,波动生成新图时甩都甩不掉。锻炼参数别照搬教程。

LoRA rank设4到8,进建率1e-4,步数800到1200的。我拿RTX 3060 12G跑,batch size 1出片。开gradient checkpointing,半小时能出第一版。

很重要看采样图,若是主体脸崩。降进建率,若是动做生硬炼条,加步数。有一次我把rank拉到32,功效猫毛酿成塑料丝,过拟合得离谱的。测试时用差异提醉词交叉考据。好比“猫正在太空”“猫穿毛衣”“猫正在雨里”,看模子可否只认锻炼图里的姿势。实正好用的ai 图片模子微调,该当让主体顺应新场景,但不是复读本图。

我习惯留存一个5张图的考据集,每200步跑一次的。肉眼比较。

不要只看loss曲线,那玩意儿会哄人。说个反曲觉的,微调不是越多越好。小数据集先跑低rank,出片不合意再慢慢加。取其堆参数的,不如花时间筛图、改标签。我见过有人用200张图训入迷级LoRA。也见过用2000张图训出废品。差距就正在数据清洗和参数曲觉上了。

本文来自网络,不代表本站立场,转载请注明出处: https://www.6abg6net.cn/article/13354.html

相关文章