sseethen/ lab探索实验室 ↗
← 返回项目列表
Python / 项目概念展示

Pocket Model Bench

用一组小而具体的个人文本任务,比较不同轻量模型在速度、格式遵循和可修正性上的表现。

基准集刻意保持小规模,样本来自标题整理、标签建议和短摘要等日常动作。每次实验都会保存输入、期望格式和模型输出,方便快速定位失败类型。

这里不追求一个脱离语境的总分,而是记录什么任务值得使用更快的模型,以及哪些失败需要交给人工或更强的模型处理。数据与指标目前都是演示内容。