首页 公共数据集 测评框架 自有数据集 模型榜单 提交测评结果 ↗

数据与任务标准化

通灵把分散的共情、情绪、社会推理与安全数据,整理为可复用的标准资源和任务视图,再以统一配置运行模型、记录指标和复核结果。

标准化可追溯按任务评分多模态
4能力维度
30数据来源
42任务变体
214指标记录

四维能力结构

情感共情发现线索,认知共情理解原因与需求,共情关怀形成支持性回应,安全交互约束边界、事实与风险。

01感知线索看见、听见、读到情绪
02理解处境推断原因、意图与需求
03形成回应选择支持策略与表达方式
04守住边界识别风险、拒绝越界与伤害

四维能力模型

每个维度都由多个数据来源和任务变体组成,按任务定义、输入模态和指标口径分别评估。

数据层与任务层

数据层负责把不同来源的文本、音频、图像和视频整理为可复用资源;任务层在资源之上声明输入、目标、标签、切分和评分方式。两层通过 sample_id、manifest 和任务配置关联,同一份数据可以服务多个任务,同一套任务也可以复用不同数据来源。

DATA LAYER数据层

来源登记、许可信息、媒体资源、样本索引与标准化清单。

dataset_meta · manifest · resources
TASK LAYER任务层

输入字段、目标类型、标签空间、数据切分与 evaluator。

task_meta · split · evaluator
RESULT LAYER结果层

模型输出、指标、运行配置与可追溯结果快照。

predictions · metrics · snapshot
LAYER 01

来源登记

不同论文与研究社区的数据在语言、标签、切分和模态上差异很大。第一步只确认来源、许可、样本划分与可用模态,不强行改写原始语义。

raw_dataset/
  source_notes.md
  license.txt
  text / audio / image / video
接口约束数据层负责适配·任务层负责定义·评测层负责执行·结果层负责追溯

评测流程

数据来源标准化资源任务视图模态匹配模型作答任务评分结果记录
01

数据准备

确认许可、来源、样本划分和可复核信息;默认优先使用 test,缺失时记录 subset 降级原因。

dataset_meta · manifest
02

任务路由

读取输入、目标和 label space,再按模型能力与样本可用模态完成任务路由。

text · image/frames · audio · video
03

模型运行

固定模型版本、采样参数、提示版本、并发与超时;单样本失败单独记录。

run_config · prompt metadata
04

指标计算

由 evaluator 解析输出并计算主指标、辅助指标或模型评委分,明确指标方向与覆盖率。

metrics.json · metrics.txt
05

质量复核

检查样本量、失败数、模态、任务和评委信息;缺关键字段的记录进入待复核。

validity · comparability
06

结果发布

补跑、纠错或模型更新后生成新快照,说明新增、替换、撤下和版本变化。

predictions · snapshot

指标与可比性

分类、回归、抽取、生成和安全判断使用不同指标。通灵以任务为最小解释单元,在同一口径内进行横向比较。

01

分类与判断

情绪、风险或选择题等离散任务。

Accuracy · F1 · WAF类别不均衡时优先查看 macro-F1 / UF1 / UAR。
02

回归与强度

情绪强度、连续分值和一致性判断。

Pearson ↑ · MAE ↓相关性和误差表达的是两种不同含义。
03

抽取与生成

关系、理由片段或参考式回应。

micro-F1 · BLEU · ROUGE-L文本重叠不等于真实共情质量。
04

安全与模型评委

支持性、拒答、泄露和依赖风险。

refusal-rate · leakage-rate模型评委需披露版本、覆盖率与效度限制。
01归一化0–1:原值 百分制:score / 100 0–7:score / 7
02统一方向越低越好 → 1 - score 或 (max - x) / (max - min)
03维度综合同一维度 = 可用细分任务的算术平均;缺失值不按 0 参与
排名边界只在同一任务、主指标、子集、输入模态和评测变体内比较。不同条件的结果不合并成单一官方总榜。

覆盖概览

30标准化数据来源

覆盖情绪、社会推理、共情回应与安全交互。

39原始结果组

保留任务、模型、配置与评测日期等上下文。

42网站任务变体

以任务定义、输入模态和目标输出为展示单位。

214模型×任务指标记录

雷达图用于概览,精确值回到单任务结果。

结果报告

五张雷达图展示归一化后的相对形状;精确结论需要同时查看任务、样本量、模态、评委和评测时间。

共情能力雷达图
n = 9 / 7 / 6 / 10

比较五个模型在情感共情、认知共情、共情关怀、安全交互四个方向的综合表现。

统一到 0–1 尺度,展示任务综合后的能力结构;精确值回到单任务结果。

READOUT综合解读
  • 五个模型呈现不同能力形状,没有单一模型可以代表完整共情能力。
  • 四个维度纳入的任务数量不同,雷达面积不能直接解释为能力总量。
  • Gemini 3.1 Pro 在前三个维度的综合结果相对更高,安全交互需要回到具体任务判断。
共情是一组能力,不是一个分数情绪感知、心理推理、支持回应和安全边界各有不同侧重。
多模态信息会改变结果视频、音频和图像带来文本中没有的线索,横向比较需标明实际输入。
综合图必须回到原始结果任何结论都应能追溯到任务指标、样本量、模态和评测日期。

平台工具

通灵将数据准备、任务定义、模型运行和结果分析拆成可组合工具;每个工具共享统一的元数据、配置和输出目录。

01

数据准备工具

登记来源、许可、模态与切分,生成标准化资源和 manifest。

list-datasets · prepare
02

任务定义工具

声明输入字段、目标类型、标签空间、提示模板和 evaluator。

task_meta · split · evaluator
03

评测执行工具

统一模型适配、采样参数、并发、超时与失败重试,保存运行配置。

bench run · run_config
04

指标结果工具

解析输出、计算指标、汇总维度并生成可追溯结果快照。

metrics · predictions · snapshot

快速使用

先用小规模样本验证数据、任务和模型连接,再扩大运行范围。

01同步环境

安装项目依赖和全部可选组件,确认命令可用。

uv sync --all-extras
02确认数据

查看可用数据来源,选择数据集、任务与目标模态。

turing2-data list-datasets
03准备资源

生成标准化 manifest 与任务所需资源;先用 limit 验证流程。

turing2-data prepare
04运行与复核

读取运行配置执行评测,再检查指标、输出和失败记录。

turing2-bench run
FIVE-MINUTE START准备、运行、查看结果
# 1. 安装与查看数据来源
uv sync --all-extras
turing2-data list-datasets

# 2. 标准化一个数据集
turing2-data prepare \
  --dataset mer2024 \
  --task mer-semi \
  --limit 100

# 3. 运行小规模验证
turing2-bench run \
  --config run.mer-semi-smoke.yaml
RESULTS ROOT
results/├─ metrics/│ ├─ metrics.json│ └─ metrics.txt├─ predictions/│ └─ outputs.jsonl└─ run_config/

可读指标、结构化指标、模型输出、解析结果、失败信息和运行配置分别保存,便于复核与重跑。

工具申请与交付

01

用途说明

说明申请主体、研究或业务用途、所需任务、数据计划和发布方式。

02

用途审核

核对商业使用、第三方服务、高风险场景和数据合规要求。

03

版本交付

审核通过后发送脚本包、版本说明、配置模板和适用文档。

04

运行反馈

保存运行配置、结果快照和异常信息,后续更新沿同一渠道管理。

运行要求先核对数据许可、模型服务条款、任务配置和输出目录;运行记录应与模型版本、输入模态、样本量和评测时间一并保存。songyu@dezhipu.com

限制与责任

公开结果服务于研究、选型和模型治理,使用时应结合任务条件、数据范围与评测配置。

输入条件差异

多模态模型可能直接接收视频、音频或图像,部分模型在同一任务中只能接收文本。结果同时反映模型能力与输入信息量差异。

运行稳定性

多数结果为单次运行,没有统一的多 seed、方差估计或置信区间;在线模型也可能静默更新。

复现范围

“已支持”表示任务可以纳入通灵框架,不代表已经完全复现原论文的 split、预处理、模型评委或运行条件。

评委效度

模型评委可能存在同源偏好、版本变化和失败覆盖率问题,相关结果应标注评委并视为本项目口径下的横向比较。

语言与文化覆盖

中文情感数据与英文安全数据的结论不能无条件跨语言迁移,数据许可与引用要求也需逐项核验。

敏感主题处理

涉及危机、自伤、操纵、隐私和越权请求的内容只用于研究性评测,不公开展示真实身份、危险输出或未经授权的媒体样本。

提交结果所需信息

请按以下四项要求准备评测提交材料

1

模型与版本模型名称、参数规模、模态输入、推理配置和发布日期

2

评测维度明确提交方向、任务、数据子集与输入模态

3

数据与协议列出使用的数据集、划分方式、许可证和是否包含私有测试集

4

指标与证据提供客观指标、人工评分规则、失败案例和可复现实验脚本

前往 GitHub 提交 ↗

研究性展示,数据持续复核。