数据准备
确认许可、来源、样本划分和可复核信息;默认优先使用 test,缺失时记录 subset 降级原因。
通灵把分散的共情、情绪、社会推理与安全数据,整理为可复用的标准资源和任务视图,再以统一配置运行模型、记录指标和复核结果。
情感共情发现线索,认知共情理解原因与需求,共情关怀形成支持性回应,安全交互约束边界、事实与风险。
每个维度都由多个数据来源和任务变体组成,按任务定义、输入模态和指标口径分别评估。
模型看见、听见或读到情绪了吗?
关注情绪类别、强度、极性、变化、微表情、伪装情绪与跨模态冲突等线索。
代表数据集 MER2024 · CAS(ME)³ · MDPE · EPITOME
模型理解对方为什么这样感受、真正需要什么了吗?
关注情绪原因、隐含需求、观点采择、关系情境、认知扭曲与社会规范推理。
代表数据集 CICERO · DialogRE · PsyQA · EmoBench
模型能把理解转化为恰当而有帮助的回应吗?
关注支持策略、积极重构、语气与角色适配、关系修复和多模态回应一致性。
代表数据集 ESConv · ProsocialDialog · AvaMERG · SpeechCraft
在高风险场景中,模型能否不迎合、不越界、不造成伤害?
关注危机、操纵、依赖、拒答、隐私、专业边界、幻觉与冲突降级能力。
代表数据集 SORRY-Bench · INTIMA · PrivacyLens · AHaBench
数据层负责把不同来源的文本、音频、图像和视频整理为可复用资源;任务层在资源之上声明输入、目标、标签、切分和评分方式。两层通过 sample_id、manifest 和任务配置关联,同一份数据可以服务多个任务,同一套任务也可以复用不同数据来源。
来源登记、许可信息、媒体资源、样本索引与标准化清单。
dataset_meta · manifest · resources输入字段、目标类型、标签空间、数据切分与 evaluator。
task_meta · split · evaluator模型输出、指标、运行配置与可追溯结果快照。
predictions · metrics · snapshot不同论文与研究社区的数据在语言、标签、切分和模态上差异很大。第一步只确认来源、许可、样本划分与可用模态,不强行改写原始语义。
raw_dataset/
source_notes.md
license.txt
text / audio / image / video
确认许可、来源、样本划分和可复核信息;默认优先使用 test,缺失时记录 subset 降级原因。
读取输入、目标和 label space,再按模型能力与样本可用模态完成任务路由。
固定模型版本、采样参数、提示版本、并发与超时;单样本失败单独记录。
由 evaluator 解析输出并计算主指标、辅助指标或模型评委分,明确指标方向与覆盖率。
检查样本量、失败数、模态、任务和评委信息;缺关键字段的记录进入待复核。
补跑、纠错或模型更新后生成新快照,说明新增、替换、撤下和版本变化。
分类、回归、抽取、生成和安全判断使用不同指标。通灵以任务为最小解释单元,在同一口径内进行横向比较。
情绪、风险或选择题等离散任务。
Accuracy · F1 · WAF类别不均衡时优先查看 macro-F1 / UF1 / UAR。情绪强度、连续分值和一致性判断。
Pearson ↑ · MAE ↓相关性和误差表达的是两种不同含义。关系、理由片段或参考式回应。
micro-F1 · BLEU · ROUGE-L文本重叠不等于真实共情质量。支持性、拒答、泄露和依赖风险。
refusal-rate · leakage-rate模型评委需披露版本、覆盖率与效度限制。0–1:原值 百分制:score / 100 0–7:score / 7越低越好 → 1 - score 或 (max - x) / (max - min)同一维度 = 可用细分任务的算术平均;缺失值不按 0 参与覆盖情绪、社会推理、共情回应与安全交互。
保留任务、模型、配置与评测日期等上下文。
以任务定义、输入模态和目标输出为展示单位。
雷达图用于概览,精确值回到单任务结果。
五张雷达图展示归一化后的相对形状;精确结论需要同时查看任务、样本量、模态、评委和评测时间。
比较五个模型在情感共情、认知共情、共情关怀、安全交互四个方向的综合表现。
统一到 0–1 尺度,展示任务综合后的能力结构;精确值回到单任务结果。
通灵将数据准备、任务定义、模型运行和结果分析拆成可组合工具;每个工具共享统一的元数据、配置和输出目录。
登记来源、许可、模态与切分,生成标准化资源和 manifest。
list-datasets · prepare声明输入字段、目标类型、标签空间、提示模板和 evaluator。
task_meta · split · evaluator统一模型适配、采样参数、并发、超时与失败重试,保存运行配置。
bench run · run_config解析输出、计算指标、汇总维度并生成可追溯结果快照。
metrics · predictions · snapshot先用小规模样本验证数据、任务和模型连接,再扩大运行范围。
安装项目依赖和全部可选组件,确认命令可用。
uv sync --all-extras查看可用数据来源,选择数据集、任务与目标模态。
turing2-data list-datasets生成标准化 manifest 与任务所需资源;先用 limit 验证流程。
turing2-data prepare读取运行配置执行评测,再检查指标、输出和失败记录。
turing2-bench run# 1. 安装与查看数据来源
uv sync --all-extras
turing2-data list-datasets
# 2. 标准化一个数据集
turing2-data prepare \
--dataset mer2024 \
--task mer-semi \
--limit 100
# 3. 运行小规模验证
turing2-bench run \
--config run.mer-semi-smoke.yaml
可读指标、结构化指标、模型输出、解析结果、失败信息和运行配置分别保存,便于复核与重跑。
说明申请主体、研究或业务用途、所需任务、数据计划和发布方式。
核对商业使用、第三方服务、高风险场景和数据合规要求。
审核通过后发送脚本包、版本说明、配置模板和适用文档。
保存运行配置、结果快照和异常信息,后续更新沿同一渠道管理。
公开结果服务于研究、选型和模型治理,使用时应结合任务条件、数据范围与评测配置。
多模态模型可能直接接收视频、音频或图像,部分模型在同一任务中只能接收文本。结果同时反映模型能力与输入信息量差异。
多数结果为单次运行,没有统一的多 seed、方差估计或置信区间;在线模型也可能静默更新。
“已支持”表示任务可以纳入通灵框架,不代表已经完全复现原论文的 split、预处理、模型评委或运行条件。
模型评委可能存在同源偏好、版本变化和失败覆盖率问题,相关结果应标注评委并视为本项目口径下的横向比较。
中文情感数据与英文安全数据的结论不能无条件跨语言迁移,数据许可与引用要求也需逐项核验。
涉及危机、自伤、操纵、隐私和越权请求的内容只用于研究性评测,不公开展示真实身份、危险输出或未经授权的媒体样本。