产品案例文档 · Product Case Study

AI审美官

基于动态权重矩阵的 AI 图像美学评估系统 —— 不同风格,不同标准。先识别图片风格,再匹配对应权重,模拟人类美学专家的真实评估方式。

产品负责人:杨家祯 2026-08-01 V3 已上线
在线体验 Demo

一套标准打不了天下

看人像摄影,你盯着面部自然度和皮肤质感;看风景,你关注光影层次和构图张力;看抽象艺术,你谈的是情感冲击和创意表达。不同风格、不同场景,审美关注点完全不同。

但现有所有 AI 图片评分工具——LAION 美学评分、火山引擎画质评估、腾讯云图片质量评分——全部用同一套权重打所有图片。这就是问题的起点。

核心创新

动态权重评估体系

AI审美官的核心设计:先识别图片风格/场景,再匹配对应的权重方案,最后进行加权评分。不是一套标准打天下,而是因"图"制宜——模拟人类美学专家的真实判断逻辑。

风格自动识别 8 维度 × 12 场景 动态权重矩阵 可执行优化建议

我每天在干什么?遇到了什么问题?

我是谁

我是快手可灵可图项目组的图像模型美学专员(纬创驻场)。说人话就是:AI 生成了大量图片,我的工作是判断这些图片好不好、能不能用、好在哪里、差在哪里。合格的入库作为模型训练的参考数据,不合格的打回去。

📎 产品 Demo:https://ai-aesthetic-demo.pages.dev — 可直接在线体验

我的一天

打开后台,面对几百张 AI 生成的图片。这些图片风格各异——上一秒还在看人像摄影,下一秒就是风景自然,再下一批可能是商业产品图或美术高考素描。我需要逐张判断质量、给出评分、筛选入库

听起来简单,但实际做起来,我每天都在跟这几个问题较劲:

"这张图到底该看重什么?"

看人像的时候,我关注主体表现和情感;切到风景,重心变成构图和光影;看到素描习作,又得换成看结构和明暗关系。不同风格的图,判断标准完全不同,但我脑子里得不停切换。切换多了就容易混,混了评分就不准。

"为什么我和同事差了15分?"

同一张图,我给 85 分,同事给 70 分。不是谁对谁错,而是每个人对"好看"的判断不同。没有统一标准的时候,谁也说服不了谁。新人来了更头疼——没有参考案例,得靠"师傅带"慢慢找感觉。

"几百张图里一大半是废的"

低质量图片占了大多数,但我得一张张看完才能筛掉。真正需要我专业判断的可能是那 30% 的中间地带,但大量时间消耗在 70% 的低质量筛选上。一天下来重复同样的判断逻辑,疲劳了评分一致性更差。

"这个问题我之前见过,但找不到了"

工作中会梳理典型 Bad Case,但都是按时间堆着的,没有按风格分类。想找"人像类手部畸形"的案例参考,得翻很久。这些经验本来可以沉淀成评估参考库,现在却散落在各处。

"我知道不好,但说不清楚为什么"

我能一眼看出这张图有问题,但很难把判断过程结构化地讲清楚。"感觉构图有问题"不够精确——是主体偏了?还是空间层次不够?需要拆解成具体维度,团队才能理解和复用。

"新人来了怎么带?"

新评估员上手需要大量"试错+纠正",没有标准化的参考案例和评分逻辑说明。如果有结构化的评估框架和典型案例库,新人培训周期可以明显缩短,团队整体评估一致性也能提升。

不光是在工作中——教培经历也让我看到了同样的问题

在可灵之前,我还有一段教培经历:和合伙人一起创办了线下美术教培工作室,也做过个人美术教学,主要带高中艺考学生。

教学中我发现,"如何评价一张画"这个问题,在教培场景里一样头疼

更关键的是,教培场景和 AI 图像评估场景的底层逻辑是一样的:都是"给图片打分 + 说出好在哪里差在哪里 + 给出改进方向"。只不过一个是给学生作品打分,一个是给 AI 生成图片打分。

这些问题让我开始想……

这些痛点不是我想出来的——一段来自可灵的一线工作经验,一段来自教培的真实教学经历,两个不同场景指向同一个问题:图片美学评估缺少一套"分场景、结构化、可量化"的工具。

当我开始想"有没有办法解决"的时候,一个想法自然浮现:如果有一套工具,能根据不同风格自动匹配不同的评估标准,把"我觉得这张图好/不好"变成结构化、可量化的评分,那这些问题是不是都能缓解?

我本科毕业于中国人民大学绘画专业,有系统的中西艺术史学习背景和扎实的美术功底。在可灵可图的实战中,我积累了大量 AI 图像质量评估的一线经验;在教培创业和教学中,我反复面对"怎么把审美判断讲清楚"的难题。专业美学判断力 + AI 图像评估实战经验 + 教学中"让审美可传递"的真实需求——这三者的交汇让我觉得,我可以试着把美学专家的评估逻辑系统化、产品化。

这就是 AI 审美官的起点。

市场上有谁在做?缺什么?

AI 图像生成领域在 2024-2025 年迎来爆发——可灵、即梦、Midjourney、Stable Diffusion 等工具让普通人也能生成高质量图片。但生成端的繁荣没有带动评估端的进步:质量评估仍然依赖人工,或者用粗糙的单一评分。

竞品对比分析
工具/方案 评估维度 动态权重 用户形态 核心缺口
LAION-AI 美学评分 单一总分 0-10 开源代码 太粗糙,只给一个分,不说哪好哪差
火山引擎画质评估 API 清晰度/噪声/美学等 15 项 无(固定维度) 开发者 API 普通人用不了,偏向物理画质非美学
阿里 Q-Judger 品质/美学/契合度/真实度/创意 学术模型 部署门槛极高,无产品化
腾讯云图片质量评分 清晰度/美观度/内容质量 开发者 API 只有 3 个维度,太浅
华为美学评分 多维度综合评分 移动端 SDK 偏手机拍照场景,不适配 AI 生图
AI审美官(本产品) 8 维度,含情感与创意 有(12 场景动态匹配) Web 产品 — 这就是机会 —

数据来源:火山引擎文档 · Communeify · 腾讯云文档 · 华为开发者联盟

关键发现:技术方案已经存在(CLIP 美学模型、视觉语言模型 API),但没有一个面向 AI 创作者的、好用的、能给出具体改进建议的美学诊断产品。全都是 API 或学术研究,没有产品化。而且——没有一个工具做到"不同风格用不同权重"。这就是切入点。

不同风格,不同标准

一句话定位:AI 审美官是一个基于动态权重的 AI 图像美学诊断工具——上传一张图片,获得 8 维度美学评分、风格识别、加权综合得分和可执行的优化建议。

AI 创作者

使用可灵/即梦/Midjourney 生成图片,但不知道结果好不好。靠感觉判断,反复盲试浪费时间。

AI 运营 / 数据标注

需要批量筛选 AI 生成内容,人工逐张看效率低,不同人评估结果不一致。

设计师 / 品牌方

用 AI 辅助设计产出,需要质量把控标准,不确定是否达到商用级别。

美术教培机构

画室老师每天批改数百张学生试卷,主观性强、标准不统一。素描/色彩/速写评分维度完全不同。

为什么"动态权重"是关键?

这是整个产品最核心的设计决策,也是与所有竞品的根本差异。

人类美学专家评估一张图片时,不会对所有图片使用同一套标准。看人像时,面部比例和皮肤质感占评估重心的 40% 以上;看风景时,光影和构图才是重点;看素描试卷时,色彩几乎不参与评分——因为素描是黑白灰的关系。

现有工具的问题在于:它们把"美学"当成一个均匀的、可以被单一分数概括的东西。但美学评估是有上下文的——同一张图在不同场景下的"好"与"坏"标准不同。

设计原理:系统首先自动识别图片的风格/场景类型,然后匹配对应的权重方案,对 8 个维度进行加权评分。不同风格的图片,同一维度的权重可能相差 3-10 倍。例如:人像摄影中"主体表现"权重高达 23%,而风景摄影中同一维度仅 5%;美术高考-色彩中"色彩"权重达 30%,而素描中仅 3%——因为素描是黑白灰的关系,色彩几乎不参与评分。

这个设计基于我在可灵可图的实际工作经验:筛选不同垂直类的图片时,我们确实使用不同的评估侧重。这不是凭空想象的功能,而是对真实工作流程的产品化抽象

8 个美学评估维度

相比现有工具的 3-5 个维度,AI审美官扩展到 8 个维度。新增的两个维度是基于一个朴素的事实:人是有感情因素的,看画不只是看"清楚不清楚"。

01构图

画面的空间组织与视觉结构

  • 主体位置与比例
  • 画面平衡感
  • 视觉引导线与视线动线
  • 空间层次与景深处理
02色彩

色彩搭配的合理性与表现力

  • 色彩搭配合理性
  • 色调统一性与偏色检测
  • 色彩表现力与饱和度控制
  • 色彩情感表达
03光影

光线与阴影的质量与氛围

  • 光源方向合理性
  • 明暗对比与层次过渡
  • 氛围感与情绪渲染
  • 阴影质量与过渡自然度
04细节质量

图像的技术质量与 AI 痕迹检测

  • 清晰度与锐度
  • 纹理质感表现力
  • 边缘处理自然度
  • AI 生成痕迹/伪影检测
05主体表现

画面主体的完整性与准确性

  • 主体完整性(无缺失/截断)
  • 结构准确性(人像:面部比例/手部/肢体)
  • 主体与背景的融合度
  • 表情/姿态自然度
06风格一致性

整体风格的统一与协调

  • 整体风格统一性
  • 画面元素间的协调性
  • 与 prompt 意图的匹配度
07情感共鸣

图片引发的情感反应与感染力

  • 情感表达力与情绪传递
  • 氛围感染力
  • 叙事性与故事感
08创意表现

创意性与艺术表达力

  • 视觉冲击力
  • 创意独特性(非套路化)
  • 艺术感染力与审美高度

第 7 维"情感共鸣"和第 8 维"创意表现"是本产品的特色维度。现有工具要么完全不考虑感性因素,要么把它混在"美学"里一笔带过。但一张技术完美但毫无情感冲击的图片,和一张有瑕疵但打动人心的图片,哪个更好?这取决于场景——而动态权重体系恰好能处理这种差异。

12 种风格 × 动态权重矩阵

每种风格场景对应一套独立的权重方案,每行权重之和为 100%。颜色越深表示权重越高。当系统无法识别风格时,使用"通用默认"权重兜底。

12种风格场景的8维度动态权重矩阵
风格 / 场景 构图 色彩 光影 细节 主体 风格 情感 创意
人像摄影15%12%18%12%23%5%10%5%
风景自然22%18%22%8%5%5%12%8%
商业产品12%22%12%23%8%8%5%10%
抽象艺术12%20%8%8%5%12%15%20%
插画动漫18%18%12%12%12%10%8%10%
建筑空间22%12%18%18%5%10%8%7%
美食摄影18%22%18%18%8%5%5%6%
时尚穿搭12%18%12%12%18%8%10%10%
美术高考-素描15%3%25%22%20%5%5%5%
美术高考-色彩15%30%15%15%12%5%3%5%
美术高考-速写15%3%10%10%25%5%15%17%
通用默认15%15%15%15%15%10%8%7%

权重设计的专业逻辑举例:

美术教培场景的设计,直接来源于我的专业背景:中国人民大学绘画本科的系统训练让我对素描、色彩、速写三科的评分标准有深入理解。这三科在美术高考中的评价维度完全不同,现有任何工具都无法处理这种差异。

从上传到报告的完整流程

1

上传图片

用户上传一张 AI 生成图片(支持 JPG/PNG),单张或批量(最多 100 张)。可选填原始 prompt,用于"风格一致性"评估。

2

风格识别

系统自动识别图片风格/场景类型(12 种 + 通用兜底)。识别基于视觉语言模型,同时支持用户手动修正。

3

权重匹配

根据识别结果自动匹配对应权重方案。用户可查看当前权重分布,理解"为什么这个维度对这张图更重要"。

4

多维度评分

对 8 个维度分别评分(0-100 分),每个维度附带诊断说明。模拟人类美学专家的判断逻辑。

5

生成报告

加权计算总分,生成诊断报告:总分、维度雷达图、各维度评分与说明、TOP 3 优化建议(含具体 prompt 改进方向)。批量模式支持四档分档(A/B/C/D)和 CSV 导出。

四档分档系统

批量模式下,评分结果自动分入四档,阈值用户可自定义:

A 档 · 优质(≥90分)

可直接入库或商用,无需人工复审。

B 档 · 良好(75-89分)

质量较好,需快速人工确认。

C 档 · 合格(60-74分)

有改进空间,需人工审核判断。

D 档 · 不合格(<60分)

质量不达标,建议直接淘汰。

这个分档设计直接来自我在可灵可图的工作经验:实际筛选流程中,我们确实会将图片分为不同质量等级。四档分档让 AI 预筛选的结果可以直接对接人工审核流程——AI 负责减少一半低质量数据筛选时间,仍需人工终审

迭代历程

产品从概念到 V3 上线,经历了三个版本的快速迭代。每个版本都有明确的目标和改进方向。

V1

核心评分引擎

验证核心逻辑:单张图片上传 → 8 维度评分 → 风格识别 → 动态权重匹配 → 诊断报告。建立了完整的产品设计文档、Coze Bot 系统提示词和 Web 应用 MVP。

单张评分 8维度框架 12场景权重 雷达图
V2

批量评分 + 四档分档

从"能评一张"升级到"能评一批"。新增批量上传(最多 100 张)、四档分档系统(A/B/C/D 可配置阈值)、进度条、结果表格、档位筛选和 CSV 导出。这让产品从"演示工具"变成了"可实际使用的工具"。

批量100张 四档分档 CSV导出 API设置互通
V3

Gallery Studio UI 重构

全面重构 UI 视觉层,采用 Gallery Studio 风格——干净、专业、像高端设计分析工具。删除了底部 Bot 教程,所有 emoji 替换为内联 SVG 图标,Header/Tabs/卡片/表格全部精致化。功能逻辑完整保留。

SVG图标 药丸式Tabs 色条卡片 hover交互

V3 已部署上线,可通过线上 Demo直接体验。当前为 Demo 模式(无 API 配置时生成模拟评分),对接 Coze Bot API 后可进行真实美学评估。

这个产品解决了什么问题?

效率提升

批量评分 + 四档分档让 AI 预筛选替代大量人工初筛。减少一半低质量数据筛选时间,仍需人工终审。人工精力可以集中在 B/C 档的判断上,而非从零开始逐张看。

标准化

8 维度评分 + 动态权重提供了一套统一、可量化的评估框架。不同人用同一套标准评估,结果可对比、可追溯。CSV 导出支持数据分析和管理。

场景适配

12 种风格场景的动态权重,让评估结果真正贴合不同场景的审美标准。不再用一套权重打所有图片——这是现有所有工具都没有做到的。

可操作性

不只是给分,还给出 TOP 3 优化建议和具体 prompt 改进方向。让创作者知道"哪里不好"和"怎么改好",形成评估-改进的闭环。

怎么知道这个产品靠不靠谱?

做出产品只是第一步,更关键的问题是:这套评估框架到底准不准?动态权重是不是真的比统一权重好?目前产品处于 Demo 阶段,还没有真实用户反馈,但这不代表可以跳过验证。以下是我设计的验证思路和下一步优化方向。

A/B 测试:动态权重 vs 统一权重

核心假设是"动态权重比统一权重更准确"。验证方法:

Step 1 · 准备测试集

选取每种风格 20-30 张图片(含好/中/差各档),请 2-3 位有经验的评估员各自打分,取平均分作为人工基准分

Step 2 · 对比评分

同一批图片分别用「统一权重」和「动态权重」跑一遍评分,对比两组结果与人工基准分的偏差大小

Step 3 · 分析结论

如果动态权重在多数风格上偏差更小,说明假设成立。如果某些风格反而更差,说明该风格的权重配比需要调整。

这个测试不需要复杂的技术,用现有 Demo 就能跑。关键是用数据说话,而不是靠感觉判断"动态权重更好"。

用户反馈收集计划

目前没有真实用户,但这不代表没法收集反馈。我的计划是:

同事试用

把 Demo 分享给可灵可图项目组的同事,让他们用自己工作中的图片试一下,回答两个问题:"评分结果符合你的判断吗?" "哪个维度的分数你觉得不合理?"

美术圈朋友

分享给学美术的朋友,特别是做美术教培的同行,看教培场景的评估逻辑是否合理。他们的专业反馈能验证权重设计的专业依据

反馈记录表

每条反馈记录:图片类型 + 人工预期分数 + 工具给出分数 + 偏差维度 + 反馈意见。积累到一定量后做系统性分析,找到偏差集中的维度和风格。

权重校准循环

权重的初始值是基于我的专业经验设定的,不是拍脑袋,但也不是最终答案。校准的逻辑是:

使用产品 → 收集反馈(人工 vs 工具评分偏差)→ 分析偏差集中的维度和风格 → 调整对应权重 → 再次验证 → 形成数据驱动的权重迭代循环

比如:如果多个人反馈"商业产品类"的细节评分偏高,而实际上该类图更看重色彩表现,就把细节权重调低、色彩权重调高,然后重新跑测试看偏差是否缩小。

下一步优化方向

对接真实 API

当前 Demo 模式是模拟评分。下一步对接视觉语言模型 API,实现真实的自动化评估,让产品可以真正使用。

典型案例库

每种风格积累 3-5 个典型案例(优质 + 典型错误),既能验证权重合理性,也能作为新人培训和评估参考

评估一致性看板

记录同一张图在不同时间、不同人手里的评分差异,用数据展示评估一致性的变化趋势,证明产品的实际价值。

风格自定义

允许用户在 12 种预设风格之外,自定义新风格和权重配比。这是从工具走向平台的关键一步。

教培场景深化

产品最初的灵感一半来自教培经历。下一步可以面向美术教培场景做专项适配——学生作品评分、艺考模拟打分、结构化教学反馈,让工具从"AI 图像评估"扩展到"通用美学评估"

多模型横评

同一张图或同一个 prompt,在不同 AI 生成模型(可灵、Midjourney、Stable Diffusion 等)下的输出表现对比,给出跨模型质量排名和差异分析。这在实际工作中是刚需。

用户贡献飞轮

允许用户上传自己的评估案例(图片 + 评分 + 反馈),沉淀到社区案例库。案例越多,权重校准越准,产品越好用——形成数据飞轮

评分→改进闭环

评分不是终点。下一步根据评分结果自动生成改进 prompt 建议——比如"色彩评分偏低,建议在 prompt 中加入'暖色调、高饱和度'"——让评估和改进形成闭环。

产品反思与未来方向

反思

这个产品验证了一个核心假设:不同风格的图片需要不同的评估权重。从市场分析到产品设计到落地执行,整个流程证明了一个有专业背景的人可以做 0-1 的 AI 产品。

同时也有清醒的认识:

这些不是产品的缺陷,而是从 Demo 走向产品化要解决的问题清单。诚实地面对这些问题,比假装产品已经完美更有价值。

远期壁垒:垂直类知识库

产品的长期竞争力不在于评分算法本身(技术门槛会持续降低),而在于积累垂直类美学评估知识库。每个评估案例的结构化记录——图片 + 风格分类 + 8 维度逐项评分 + 亮点 + 不足 + 改进建议 + 正反标签——将成为持续优化权重方案和评估标准的核心资产。

失败案例比成功案例更重要:知道"什么是差的"比知道"什么是好的"更有价值,因为大部分 AI 生成图片的问题是重复的。

MVP 阶段

典型案例库

每种风格积累 3-5 个典型案例(优质 + 典型错误),用于验证权重方案的合理性。

中期

规模化积累

每种风格 20-50 个案例,来源为脱敏后的实际工作数据。建立案例检索和对比能力。

远期

用户贡献飞轮

用户上传图片获得评估的同时贡献案例数据。评分模型基于真实反馈持续微调,形成数据飞轮。

技术路线

当前使用视觉语言模型 + prompt 工程实现评估逻辑。未来可以探索:基于知识库数据微调专用美学评估模型;多模型横评能力(同一张图在不同生成模型下的表现对比);prompt 自动优化(根据评分结果反向生成改进 prompt)。