EVALUATION / OVERVIEW

让每次变化都有数字回答

检查 Judge…

VIRALTEST · GOLD SET

不是“感觉更好了”,
是知道好在哪里。

固定案例、版本盲化、独立 Agent Judge 与人类 pairwise 投票,把每次模型或拆解逻辑变动转成可追踪的偏好信号。

候选版本均分/ 100
证据 20%
结构 15%
复用 15%
固定金标有效视频案例
版本快照不可变输出集
已完成盲评可回溯实验
人类偏好RLHF 投票信号

LATEST EXPERIMENT

最近一次版本对比

还没有评测。先导入两个结果快照。

PREFERENCE LOOP

偏好闭环

  1. 01固定金标集视频 + 人工拆解
  2. 02Agent 盲评Codex / 兼容模型
  3. 03人类投票Pairwise preference
  4. 04偏好数据DPO / RLHF JSONL

TEAM WORKLOAD

用户盲测工作量

读取中…

ASSIGNED REVIEWS

用户盲测任务

读取中…

ISOLATED VERSION RUN

同配置运行 v1.1.2 × v1.1.3

从 Git 标签只读导出隔离副本,不读写 ViralLens 工作目录;真实模型调用可能产生费用。

2 TAGS

RUN CONFIG

实验控制变量

相同模型 · 相同商品 · 相同时长
API 覆盖配置(留空读取 benchmark/.env)

DEFAULT PRODUCT FACTS

默认我方商品事实

优先从 ViralLens 数据库只读载入;提交时会复制事实快照,后续修改商品不会污染历史实验。

将产生 15 × 2 次完整拆解任务;每个任务还会执行脚本生成。请先确认模型配额与商品事实。

ENDLESS BLIND ARENA

同一视频,两两 PK

原因必填;投票前不显示版本、Prompt 或 AI 分数,投票后才揭晓。

MY ASSIGNMENTS

我的盲测任务

读取中…
选择一条历史评测,或新建一次 A/B 盲评。

GOLD DATASET

ViralTest v1

仅使用有拆解名称与编号的 15 条记录;空白表单行自动排除。

15 CASES

SCORING CONTRACT

85% Agent 语义分 + 15% 客观合同分

客观合同分检查字段完整度、时间线顺序和证据密度;Agent 不接收版本名,只看到人工参考与 A/B 输出。

IMMUTABLE OUTPUTS

版本快照

一次快照保存一组拆解结果。推荐 revision 写入 Git SHA、Prompt 版本或模型标识。

导入格式{ "label": "v1.3", "revision": "git-sha", "items": [{ "case_key": "NO.001", "output": { ... } }] }也支持直接导入 FullAnalysis 数组,使用 source.title 自动匹配。