一套标准打不了天下
看人像摄影,你盯着面部自然度和皮肤质感;看风景,你关注光影层次和构图张力;看抽象艺术,你谈的是情感冲击和创意表达。不同风格、不同场景,审美关注点完全不同。
但现有所有 AI 图片评分工具——LAION 美学评分、火山引擎画质评估、腾讯云图片质量评分——全部用同一套权重打所有图片。这就是问题的起点。
动态权重评估体系
AI审美官的核心设计:先识别图片风格/场景,再匹配对应的权重方案,最后进行加权评分。不是一套标准打天下,而是因"图"制宜——模拟人类美学专家的真实判断逻辑。
我每天在干什么?遇到了什么问题?
我是谁
我是快手可灵可图项目组的图像模型美学专员(纬创驻场)。说人话就是:AI 生成了大量图片,我的工作是判断这些图片好不好、能不能用、好在哪里、差在哪里。合格的入库作为模型训练的参考数据,不合格的打回去。
📎 产品 Demo:https://ai-aesthetic-demo.pages.dev — 可直接在线体验
我的一天
打开后台,面对几百张 AI 生成的图片。这些图片风格各异——上一秒还在看人像摄影,下一秒就是风景自然,再下一批可能是商业产品图或美术高考素描。我需要逐张判断质量、给出评分、筛选入库。
听起来简单,但实际做起来,我每天都在跟这几个问题较劲:
"这张图到底该看重什么?"
看人像的时候,我关注主体表现和情感;切到风景,重心变成构图和光影;看到素描习作,又得换成看结构和明暗关系。不同风格的图,判断标准完全不同,但我脑子里得不停切换。切换多了就容易混,混了评分就不准。
"为什么我和同事差了15分?"
同一张图,我给 85 分,同事给 70 分。不是谁对谁错,而是每个人对"好看"的判断不同。没有统一标准的时候,谁也说服不了谁。新人来了更头疼——没有参考案例,得靠"师傅带"慢慢找感觉。
"几百张图里一大半是废的"
低质量图片占了大多数,但我得一张张看完才能筛掉。真正需要我专业判断的可能是那 30% 的中间地带,但大量时间消耗在 70% 的低质量筛选上。一天下来重复同样的判断逻辑,疲劳了评分一致性更差。
"这个问题我之前见过,但找不到了"
工作中会梳理典型 Bad Case,但都是按时间堆着的,没有按风格分类。想找"人像类手部畸形"的案例参考,得翻很久。这些经验本来可以沉淀成评估参考库,现在却散落在各处。
"我知道不好,但说不清楚为什么"
我能一眼看出这张图有问题,但很难把判断过程结构化地讲清楚。"感觉构图有问题"不够精确——是主体偏了?还是空间层次不够?需要拆解成具体维度,团队才能理解和复用。
"新人来了怎么带?"
新评估员上手需要大量"试错+纠正",没有标准化的参考案例和评分逻辑说明。如果有结构化的评估框架和典型案例库,新人培训周期可以明显缩短,团队整体评估一致性也能提升。
不光是在工作中——教培经历也让我看到了同样的问题
在可灵之前,我还有一段教培经历:和合伙人一起创办了线下美术教培工作室,也做过个人美术教学,主要带高中艺考学生。
教学中我发现,"如何评价一张画"这个问题,在教培场景里一样头疼:
- 评分标准因人而异:同一个学生的素描,A 老师说结构不错给 80,B 老师说光影不够给 65。家长问"到底什么水平",我很难给出一个结构化的回答。
- 反馈说不清楚:我知道这张画的问题在哪,但跟学生说"感觉不对"没用。得拆成具体维度——构图偏了、明暗交界线不明确、主体比例失调——学生才能改。
- 不同科目标准不同:素描重光影和结构,色彩重色调和笔触,速写重动态和比例。跟可灵遇到的问题一模一样——一套标准打不了天下。
- 新人老师上手慢:没有标准化的参考案例和评分逻辑,新老师全靠自己摸索,教学质量参差不齐。
更关键的是,教培场景和 AI 图像评估场景的底层逻辑是一样的:都是"给图片打分 + 说出好在哪里差在哪里 + 给出改进方向"。只不过一个是给学生作品打分,一个是给 AI 生成图片打分。
这些问题让我开始想……
这些痛点不是我想出来的——一段来自可灵的一线工作经验,一段来自教培的真实教学经历,两个不同场景指向同一个问题:图片美学评估缺少一套"分场景、结构化、可量化"的工具。
当我开始想"有没有办法解决"的时候,一个想法自然浮现:如果有一套工具,能根据不同风格自动匹配不同的评估标准,把"我觉得这张图好/不好"变成结构化、可量化的评分,那这些问题是不是都能缓解?
我本科毕业于中国人民大学绘画专业,有系统的中西艺术史学习背景和扎实的美术功底。在可灵可图的实战中,我积累了大量 AI 图像质量评估的一线经验;在教培创业和教学中,我反复面对"怎么把审美判断讲清楚"的难题。专业美学判断力 + AI 图像评估实战经验 + 教学中"让审美可传递"的真实需求——这三者的交汇让我觉得,我可以试着把美学专家的评估逻辑系统化、产品化。
这就是 AI 审美官的起点。
市场上有谁在做?缺什么?
AI 图像生成领域在 2024-2025 年迎来爆发——可灵、即梦、Midjourney、Stable Diffusion 等工具让普通人也能生成高质量图片。但生成端的繁荣没有带动评估端的进步:质量评估仍然依赖人工,或者用粗糙的单一评分。
| 工具/方案 | 评估维度 | 动态权重 | 用户形态 | 核心缺口 |
|---|---|---|---|---|
| LAION-AI 美学评分 | 单一总分 0-10 | 无 | 开源代码 | 太粗糙,只给一个分,不说哪好哪差 |
| 火山引擎画质评估 API | 清晰度/噪声/美学等 15 项 | 无(固定维度) | 开发者 API | 普通人用不了,偏向物理画质非美学 |
| 阿里 Q-Judger | 品质/美学/契合度/真实度/创意 | 无 | 学术模型 | 部署门槛极高,无产品化 |
| 腾讯云图片质量评分 | 清晰度/美观度/内容质量 | 无 | 开发者 API | 只有 3 个维度,太浅 |
| 华为美学评分 | 多维度综合评分 | 无 | 移动端 SDK | 偏手机拍照场景,不适配 AI 生图 |
| AI审美官(本产品) | 8 维度,含情感与创意 | 有(12 场景动态匹配) | Web 产品 | — 这就是机会 — |
数据来源:火山引擎文档 · Communeify · 腾讯云文档 · 华为开发者联盟
关键发现:技术方案已经存在(CLIP 美学模型、视觉语言模型 API),但没有一个面向 AI 创作者的、好用的、能给出具体改进建议的美学诊断产品。全都是 API 或学术研究,没有产品化。而且——没有一个工具做到"不同风格用不同权重"。这就是切入点。
不同风格,不同标准
一句话定位:AI 审美官是一个基于动态权重的 AI 图像美学诊断工具——上传一张图片,获得 8 维度美学评分、风格识别、加权综合得分和可执行的优化建议。
AI 创作者
使用可灵/即梦/Midjourney 生成图片,但不知道结果好不好。靠感觉判断,反复盲试浪费时间。
AI 运营 / 数据标注
需要批量筛选 AI 生成内容,人工逐张看效率低,不同人评估结果不一致。
设计师 / 品牌方
用 AI 辅助设计产出,需要质量把控标准,不确定是否达到商用级别。
美术教培机构
画室老师每天批改数百张学生试卷,主观性强、标准不统一。素描/色彩/速写评分维度完全不同。
为什么"动态权重"是关键?
这是整个产品最核心的设计决策,也是与所有竞品的根本差异。
人类美学专家评估一张图片时,不会对所有图片使用同一套标准。看人像时,面部比例和皮肤质感占评估重心的 40% 以上;看风景时,光影和构图才是重点;看素描试卷时,色彩几乎不参与评分——因为素描是黑白灰的关系。
现有工具的问题在于:它们把"美学"当成一个均匀的、可以被单一分数概括的东西。但美学评估是有上下文的——同一张图在不同场景下的"好"与"坏"标准不同。
这个设计基于我在可灵可图的实际工作经验:筛选不同垂直类的图片时,我们确实使用不同的评估侧重。这不是凭空想象的功能,而是对真实工作流程的产品化抽象。
8 个美学评估维度
相比现有工具的 3-5 个维度,AI审美官扩展到 8 个维度。新增的两个维度是基于一个朴素的事实:人是有感情因素的,看画不只是看"清楚不清楚"。
画面的空间组织与视觉结构
- 主体位置与比例
- 画面平衡感
- 视觉引导线与视线动线
- 空间层次与景深处理
色彩搭配的合理性与表现力
- 色彩搭配合理性
- 色调统一性与偏色检测
- 色彩表现力与饱和度控制
- 色彩情感表达
光线与阴影的质量与氛围
- 光源方向合理性
- 明暗对比与层次过渡
- 氛围感与情绪渲染
- 阴影质量与过渡自然度
图像的技术质量与 AI 痕迹检测
- 清晰度与锐度
- 纹理质感表现力
- 边缘处理自然度
- AI 生成痕迹/伪影检测
画面主体的完整性与准确性
- 主体完整性(无缺失/截断)
- 结构准确性(人像:面部比例/手部/肢体)
- 主体与背景的融合度
- 表情/姿态自然度
整体风格的统一与协调
- 整体风格统一性
- 画面元素间的协调性
- 与 prompt 意图的匹配度
图片引发的情感反应与感染力
- 情感表达力与情绪传递
- 氛围感染力
- 叙事性与故事感
创意性与艺术表达力
- 视觉冲击力
- 创意独特性(非套路化)
- 艺术感染力与审美高度
第 7 维"情感共鸣"和第 8 维"创意表现"是本产品的特色维度。现有工具要么完全不考虑感性因素,要么把它混在"美学"里一笔带过。但一张技术完美但毫无情感冲击的图片,和一张有瑕疵但打动人心的图片,哪个更好?这取决于场景——而动态权重体系恰好能处理这种差异。
12 种风格 × 动态权重矩阵
每种风格场景对应一套独立的权重方案,每行权重之和为 100%。颜色越深表示权重越高。当系统无法识别风格时,使用"通用默认"权重兜底。
| 风格 / 场景 | 构图 | 色彩 | 光影 | 细节 | 主体 | 风格 | 情感 | 创意 |
|---|---|---|---|---|---|---|---|---|
| 人像摄影 | 15% | 12% | 18% | 12% | 23% | 5% | 10% | 5% |
| 风景自然 | 22% | 18% | 22% | 8% | 5% | 5% | 12% | 8% |
| 商业产品 | 12% | 22% | 12% | 23% | 8% | 8% | 5% | 10% |
| 抽象艺术 | 12% | 20% | 8% | 8% | 5% | 12% | 15% | 20% |
| 插画动漫 | 18% | 18% | 12% | 12% | 12% | 10% | 8% | 10% |
| 建筑空间 | 22% | 12% | 18% | 18% | 5% | 10% | 8% | 7% |
| 美食摄影 | 18% | 22% | 18% | 18% | 8% | 5% | 5% | 6% |
| 时尚穿搭 | 12% | 18% | 12% | 12% | 18% | 8% | 10% | 10% |
| 美术高考-素描 | 15% | 3% | 25% | 22% | 20% | 5% | 5% | 5% |
| 美术高考-色彩 | 15% | 30% | 15% | 15% | 12% | 5% | 3% | 5% |
| 美术高考-速写 | 15% | 3% | 10% | 10% | 25% | 5% | 15% | 17% |
| 通用默认 | 15% | 15% | 15% | 15% | 15% | 10% | 8% | 7% |
权重设计的专业逻辑举例:
- 素描 vs 色彩:素描中"色彩"权重仅 3%(几乎不参与),而色彩中高达 30%。因为素描考察的是黑白灰关系、光影和结构,色彩考察的是色彩关系和色调统一——这是美术高考的基本常识,但现有工具完全不区分。
- 人像 vs 风景:人像中"主体表现"权重 23%(面部比例、表情自然度最重要),风景中仅 5%(没有明确主体)。风景更看重构图(22%)和光影(22%)。
- 抽象艺术:创意表现权重 20%、情感共鸣 15%——因为抽象艺术的价值恰恰在于创意和情感表达,而非技术细节(仅 8%)。
美术教培场景的设计,直接来源于我的专业背景:中国人民大学绘画本科的系统训练让我对素描、色彩、速写三科的评分标准有深入理解。这三科在美术高考中的评价维度完全不同,现有任何工具都无法处理这种差异。
从上传到报告的完整流程
上传图片
用户上传一张 AI 生成图片(支持 JPG/PNG),单张或批量(最多 100 张)。可选填原始 prompt,用于"风格一致性"评估。
风格识别
系统自动识别图片风格/场景类型(12 种 + 通用兜底)。识别基于视觉语言模型,同时支持用户手动修正。
权重匹配
根据识别结果自动匹配对应权重方案。用户可查看当前权重分布,理解"为什么这个维度对这张图更重要"。
多维度评分
对 8 个维度分别评分(0-100 分),每个维度附带诊断说明。模拟人类美学专家的判断逻辑。
生成报告
加权计算总分,生成诊断报告:总分、维度雷达图、各维度评分与说明、TOP 3 优化建议(含具体 prompt 改进方向)。批量模式支持四档分档(A/B/C/D)和 CSV 导出。
四档分档系统
批量模式下,评分结果自动分入四档,阈值用户可自定义:
A 档 · 优质(≥90分)
可直接入库或商用,无需人工复审。
B 档 · 良好(75-89分)
质量较好,需快速人工确认。
C 档 · 合格(60-74分)
有改进空间,需人工审核判断。
D 档 · 不合格(<60分)
质量不达标,建议直接淘汰。
这个分档设计直接来自我在可灵可图的工作经验:实际筛选流程中,我们确实会将图片分为不同质量等级。四档分档让 AI 预筛选的结果可以直接对接人工审核流程——AI 负责减少一半低质量数据筛选时间,仍需人工终审。
迭代历程
产品从概念到 V3 上线,经历了三个版本的快速迭代。每个版本都有明确的目标和改进方向。
核心评分引擎
验证核心逻辑:单张图片上传 → 8 维度评分 → 风格识别 → 动态权重匹配 → 诊断报告。建立了完整的产品设计文档、Coze Bot 系统提示词和 Web 应用 MVP。
批量评分 + 四档分档
从"能评一张"升级到"能评一批"。新增批量上传(最多 100 张)、四档分档系统(A/B/C/D 可配置阈值)、进度条、结果表格、档位筛选和 CSV 导出。这让产品从"演示工具"变成了"可实际使用的工具"。
Gallery Studio UI 重构
全面重构 UI 视觉层,采用 Gallery Studio 风格——干净、专业、像高端设计分析工具。删除了底部 Bot 教程,所有 emoji 替换为内联 SVG 图标,Header/Tabs/卡片/表格全部精致化。功能逻辑完整保留。
V3 已部署上线,可通过线上 Demo直接体验。当前为 Demo 模式(无 API 配置时生成模拟评分),对接 Coze Bot API 后可进行真实美学评估。
这个产品解决了什么问题?
效率提升
批量评分 + 四档分档让 AI 预筛选替代大量人工初筛。减少一半低质量数据筛选时间,仍需人工终审。人工精力可以集中在 B/C 档的判断上,而非从零开始逐张看。
标准化
8 维度评分 + 动态权重提供了一套统一、可量化的评估框架。不同人用同一套标准评估,结果可对比、可追溯。CSV 导出支持数据分析和管理。
场景适配
12 种风格场景的动态权重,让评估结果真正贴合不同场景的审美标准。不再用一套权重打所有图片——这是现有所有工具都没有做到的。
可操作性
不只是给分,还给出 TOP 3 优化建议和具体 prompt 改进方向。让创作者知道"哪里不好"和"怎么改好",形成评估-改进的闭环。
怎么知道这个产品靠不靠谱?
做出产品只是第一步,更关键的问题是:这套评估框架到底准不准?动态权重是不是真的比统一权重好?目前产品处于 Demo 阶段,还没有真实用户反馈,但这不代表可以跳过验证。以下是我设计的验证思路和下一步优化方向。
A/B 测试:动态权重 vs 统一权重
核心假设是"动态权重比统一权重更准确"。验证方法:
Step 1 · 准备测试集
选取每种风格 20-30 张图片(含好/中/差各档),请 2-3 位有经验的评估员各自打分,取平均分作为人工基准分。
Step 2 · 对比评分
同一批图片分别用「统一权重」和「动态权重」跑一遍评分,对比两组结果与人工基准分的偏差大小。
Step 3 · 分析结论
如果动态权重在多数风格上偏差更小,说明假设成立。如果某些风格反而更差,说明该风格的权重配比需要调整。
这个测试不需要复杂的技术,用现有 Demo 就能跑。关键是用数据说话,而不是靠感觉判断"动态权重更好"。
用户反馈收集计划
目前没有真实用户,但这不代表没法收集反馈。我的计划是:
同事试用
把 Demo 分享给可灵可图项目组的同事,让他们用自己工作中的图片试一下,回答两个问题:"评分结果符合你的判断吗?" "哪个维度的分数你觉得不合理?"
美术圈朋友
分享给学美术的朋友,特别是做美术教培的同行,看教培场景的评估逻辑是否合理。他们的专业反馈能验证权重设计的专业依据。
反馈记录表
每条反馈记录:图片类型 + 人工预期分数 + 工具给出分数 + 偏差维度 + 反馈意见。积累到一定量后做系统性分析,找到偏差集中的维度和风格。
权重校准循环
权重的初始值是基于我的专业经验设定的,不是拍脑袋,但也不是最终答案。校准的逻辑是:
使用产品 → 收集反馈(人工 vs 工具评分偏差)→ 分析偏差集中的维度和风格 → 调整对应权重 → 再次验证 → 形成数据驱动的权重迭代循环
比如:如果多个人反馈"商业产品类"的细节评分偏高,而实际上该类图更看重色彩表现,就把细节权重调低、色彩权重调高,然后重新跑测试看偏差是否缩小。
下一步优化方向
对接真实 API
当前 Demo 模式是模拟评分。下一步对接视觉语言模型 API,实现真实的自动化评估,让产品可以真正使用。
典型案例库
每种风格积累 3-5 个典型案例(优质 + 典型错误),既能验证权重合理性,也能作为新人培训和评估参考。
评估一致性看板
记录同一张图在不同时间、不同人手里的评分差异,用数据展示评估一致性的变化趋势,证明产品的实际价值。
风格自定义
允许用户在 12 种预设风格之外,自定义新风格和权重配比。这是从工具走向平台的关键一步。
教培场景深化
产品最初的灵感一半来自教培经历。下一步可以面向美术教培场景做专项适配——学生作品评分、艺考模拟打分、结构化教学反馈,让工具从"AI 图像评估"扩展到"通用美学评估"。
多模型横评
同一张图或同一个 prompt,在不同 AI 生成模型(可灵、Midjourney、Stable Diffusion 等)下的输出表现对比,给出跨模型质量排名和差异分析。这在实际工作中是刚需。
用户贡献飞轮
允许用户上传自己的评估案例(图片 + 评分 + 反馈),沉淀到社区案例库。案例越多,权重校准越准,产品越好用——形成数据飞轮。
评分→改进闭环
评分不是终点。下一步根据评分结果自动生成改进 prompt 建议——比如"色彩评分偏低,建议在 prompt 中加入'暖色调、高饱和度'"——让评估和改进形成闭环。
产品反思与未来方向
反思
这个产品验证了一个核心假设:不同风格的图片需要不同的评估权重。从市场分析到产品设计到落地执行,整个流程证明了一个有专业背景的人可以做 0-1 的 AI 产品。
同时也有清醒的认识:
- 当前版本是 Demo 模式,评分依赖视觉语言模型,还没有对接真实 API,不能直接用于生产环境。
- 权重是基于专业经验设定的初始值,没有经过数据验证。A/B 测试和用户反馈是下一步必须做的事。
- 12 种风格的覆盖面有限,真实场景中的图片风格远不止这些,风格识别本身也需要更智能的方案。
- 目前没有真实用户,产品价值还停留在逻辑推演层面,需要实际使用数据来证明。
这些不是产品的缺陷,而是从 Demo 走向产品化要解决的问题清单。诚实地面对这些问题,比假装产品已经完美更有价值。
远期壁垒:垂直类知识库
产品的长期竞争力不在于评分算法本身(技术门槛会持续降低),而在于积累垂直类美学评估知识库。每个评估案例的结构化记录——图片 + 风格分类 + 8 维度逐项评分 + 亮点 + 不足 + 改进建议 + 正反标签——将成为持续优化权重方案和评估标准的核心资产。
失败案例比成功案例更重要:知道"什么是差的"比知道"什么是好的"更有价值,因为大部分 AI 生成图片的问题是重复的。
典型案例库
每种风格积累 3-5 个典型案例(优质 + 典型错误),用于验证权重方案的合理性。
规模化积累
每种风格 20-50 个案例,来源为脱敏后的实际工作数据。建立案例检索和对比能力。
用户贡献飞轮
用户上传图片获得评估的同时贡献案例数据。评分模型基于真实反馈持续微调,形成数据飞轮。
技术路线
当前使用视觉语言模型 + prompt 工程实现评估逻辑。未来可以探索:基于知识库数据微调专用美学评估模型;多模型横评能力(同一张图在不同生成模型下的表现对比);prompt 自动优化(根据评分结果反向生成改进 prompt)。