Appearance
解题模式、注意点与特殊技巧
本页按题目逐篇阅读后抽取,只保留可推广的模式。重复或低价值细节会合并到已有模式中;每条都标注来源原题,方便回到原题查看上下文。
指标先行
用评分函数决定验证指标
如果题目最终分数不是普通 accuracy,就不要用训练 loss 或默认 accuracy 选参。应复现评分脚本,至少在本地验证时计算同类指标。
来源原题:MAGIC、信用卡欺诈、Drum Beat Counter、CAPTCHA、Chicken Counting。
阈值是模型的一部分
F1、F-beta、多标签 strict accuracy、分割 IoU、事件 MAE 都会被阈值强烈影响。保存概率或连续分数,在验证集上扫描阈值通常比改模型结构更直接。
来源原题:Synthetic Speech、Word Segmentation、Cosmic Probe、Expired、Weather。
同时看指标的两个边
几何均值、Macro F1、precision/recall 罚分会惩罚“只救一边”。调参时要拆分看每类召回、误报、旧类/新类或 good/bad 子集。
来源原题:Underfit CV、Language Distribution、信用卡欺诈。
验证与泄漏
切分方式要模拟测试结构
时间预测用时间切分,行为克隆按 episode 切分,音乐/长音频按歌曲或谱面分组,主体识别按个体或场景检查稳定性。随机切分只能用于对照实验,不应作为最终选参依据。
来源原题:预测性维护、自行车共享、无人机飞控、MusicArtist、豹猫个体识别。
时间特征必须 as-of
任何预测日期之后的日志、故障、维护、目标组成列或未来 rolling 信息都会形成泄漏。构造特征时先明确“当前样本能看到什么”。
完美分数要反查数据质量
当模型接近满分,先检查单特征泄漏、重复样本、标签后验字段、训练测试重叠和异常 feature importance,而不是直接加复杂模型。
特征与建模
受限模型时,把领域先验写进特征
当模型、参数量、特征维度或训练数据受限时,优先设计有物理/统计意义的特征。树模型或小模型在好特征上通常强于盲目堆网络。
来源原题:口袋里的运动侦探、Cosmic Probe、Molecular Energy、无人机飞控。
用不变性减少泛化负担
分子、点云、传感器和图像细粒度任务常有平移、旋转、尺度或主体位置变化。距离矩阵、模长、主轴、主体裁剪、颜色指数等特征能减少模型需要自己学习的不变性。
来源原题:Molecular Energy、口袋里的运动侦探、豹猫个体识别、眼部疾病。
小样本优先轻量补丁和先验
当只有少量样本修复已有模型时,冻结主体、训练小 adapter/head、蒸馏旧模型或融合新旧概率,比全量微调更稳。
来源原题:Underfit CV、Help BOBAI、Madarian Cow。
只有正例时,负样本构造就是核心
图文匹配、检索和对比学习任务如果只给正例,需要人工构造随机负样本,再逐步加入 hard negative。负样本比例、难度和动态重采样比模型深度更关键。
时序、音频与事件
检测后计数要按计数指标调
如果评分只看数量或事件 IoU,帧级检测 F1 只是辅助。峰值阈值、最小峰间距、NMS 和连续正帧合并要直接对齐最终计数/事件分。
来源原题:Drum Beat Counter、SwitchSnap、Chicken Counting。
长音频/长序列可切片预测再汇总
长音频整段训练成本高且样本少。切片训练、片段预测平均、时间平移和裁剪增强能增加样本数;但切分验证必须避免同一原始样本泄漏。
来源原题:MusicArtist、APOAI T2 Audio。
短促事件需要时间敏感 pooling
咳嗽、喷嚏、响指、鼓点这类短事件可能被 mean pooling 稀释。max pooling、attention pooling、较小 hop length 和局部差分通常更有效。
来源原题:APOAI T2 Audio、SwitchSnap、Drum Beat Counter。
视觉与空间任务
先定位,再识别或判断动作
当判别信息集中在局部区域时,全图 resize 会稀释细节。先找 ROI、crop 或提取关键点,再做分类/动作检测更稳。
来源原题:SwitchSnap、豹猫个体识别、眼部疾病、Restroom。
查询内相对判断优先于独立分类
如果题目给出“四选一异类”“同组匹配”“同 restroom 配对”等结构,推理时要利用组内关系。即使单张分类不准,相似度排序也可能正确。
稀疏 mask 任务要调后处理
分割、雷达和像素选择任务中,阈值、连通域、形态学、边界裁剪、保留比例经常决定最终分。像素 accuracy 容易被背景掩盖。
来源原题:Radar At-Home、Individual Radar、Weather、Pixel Efficiency。
文本与多模态
传统文本基线不可省
TF-IDF、字符 n-gram、LinearSVC/Logistic 往往是短文本和新闻分类的强基线,也能为深度模型提供 sanity check。
来源原题:APOAI Mock Text、图文匹配。
合成训练到真实测试要重设目标分布
训练分布极偏、测试均衡时,不要按训练比例验证。应构造接近测试目标的验证或至少按 Macro F1、少数类 recall 选参。
来源原题:Language Distribution。
符号/图标序列要保留顺序和核心位置
图标提示、emoji、短文本 clue 等任务中,首个符号通常表示核心概念,后续符号用于限定和消歧。文本化或 embedding 检索时不要丢顺序。
先候选生成,再用约束重排
隐藏状态反演、分词、音乐重构、图标提示都可以先生成候选,再用语言模型、词典、乐理或评测代理做重排。候选召回和约束权重都需要调。
来源原题:Mid-Layer Inversion、Word Segmentation、JSB Chorales、Concepts。
规则、物理与工程约束
能写规则就不要全交给模型
OCR 日期计算、音乐对位、单摆动力学、分子对称性这类任务有明确规则或方程。模型可以补充感知和噪声鲁棒性,但规则应进入主路径或后处理。
来源原题:Expired、JSB Chorales、Pendulum、Molecular Energy。
受限运行环境下调资源参数
有时间、内存、参数量、推理耗时限制时,模型大小、输入分辨率、batch size、缓存策略和是否重复加载权重都是超参数。
来源原题:Image Fitting、无人机飞控、眼部疾病、APOAI T2 Audio。
提交格式和 id 对齐要单独验
很多题的 0 分风险不是模型,而是列顺序、无表头要求、id 顺序、shape/dtype、文件名、标签反编码或隐藏 lock 流程。写提交前应做格式校验。