VIRALTEST · GOLD SET
不是“感觉更好了”,
是知道好在哪里。
固定案例、版本盲化、独立 Agent Judge 与人类 pairwise 投票,把每次模型或拆解逻辑变动转成可追踪的偏好信号。
候选版本均分—/ 100
证据 20%
结构 15%
复用 15%
EVALUATION / OVERVIEW
VIRALTEST · GOLD SET
固定案例、版本盲化、独立 Agent Judge 与人类 pairwise 投票,把每次模型或拆解逻辑变动转成可追踪的偏好信号。
LATEST EXPERIMENT
PREFERENCE LOOP
TEAM WORKLOAD
ASSIGNED REVIEWS
ISOLATED VERSION RUN
从 Git 标签只读导出隔离副本,不读写 ViralLens 工作目录;真实模型调用可能产生费用。
ENDLESS BLIND ARENA
原因必填;投票前不显示版本、Prompt 或 AI 分数,投票后才揭晓。
MY ASSIGNMENTS
GOLD DATASET
仅使用有拆解名称与编号的 15 条记录;空白表单行自动排除。
SCORING CONTRACT
客观合同分检查字段完整度、时间线顺序和证据密度;Agent 不接收版本名,只看到人工参考与 A/B 输出。
IMMUTABLE OUTPUTS
一次快照保存一组拆解结果。推荐 revision 写入 Git SHA、Prompt 版本或模型标识。
{ "label": "v1.3", "revision": "git-sha", "items": [{ "case_key": "NO.001", "output": { ... } }] }也支持直接导入 FullAnalysis 数组,使用 source.title 自动匹配。