Skip to content

解题模式、注意点与特殊技巧

本页按题目逐篇阅读后抽取,只保留可推广的模式。重复或低价值细节会合并到已有模式中;每条都标注来源原题,方便回到原题查看上下文。

指标先行

用评分函数决定验证指标

如果题目最终分数不是普通 accuracy,就不要用训练 loss 或默认 accuracy 选参。应复现评分脚本,至少在本地验证时计算同类指标。

来源原题:MAGIC信用卡欺诈Drum Beat CounterCAPTCHAChicken Counting

阈值是模型的一部分

F1、F-beta、多标签 strict accuracy、分割 IoU、事件 MAE 都会被阈值强烈影响。保存概率或连续分数,在验证集上扫描阈值通常比改模型结构更直接。

来源原题:Synthetic SpeechWord SegmentationCosmic ProbeExpiredWeather

同时看指标的两个边

几何均值、Macro F1、precision/recall 罚分会惩罚“只救一边”。调参时要拆分看每类召回、误报、旧类/新类或 good/bad 子集。

来源原题:Underfit CVLanguage Distribution信用卡欺诈

验证与泄漏

切分方式要模拟测试结构

时间预测用时间切分,行为克隆按 episode 切分,音乐/长音频按歌曲或谱面分组,主体识别按个体或场景检查稳定性。随机切分只能用于对照实验,不应作为最终选参依据。

来源原题:预测性维护自行车共享无人机飞控MusicArtist豹猫个体识别

时间特征必须 as-of

任何预测日期之后的日志、故障、维护、目标组成列或未来 rolling 信息都会形成泄漏。构造特征时先明确“当前样本能看到什么”。

来源原题:预测性维护自行车共享

完美分数要反查数据质量

当模型接近满分,先检查单特征泄漏、重复样本、标签后验字段、训练测试重叠和异常 feature importance,而不是直接加复杂模型。

来源原题:蘑菇毒性信用卡欺诈

特征与建模

受限模型时,把领域先验写进特征

当模型、参数量、特征维度或训练数据受限时,优先设计有物理/统计意义的特征。树模型或小模型在好特征上通常强于盲目堆网络。

来源原题:口袋里的运动侦探Cosmic ProbeMolecular Energy无人机飞控

用不变性减少泛化负担

分子、点云、传感器和图像细粒度任务常有平移、旋转、尺度或主体位置变化。距离矩阵、模长、主轴、主体裁剪、颜色指数等特征能减少模型需要自己学习的不变性。

来源原题:Molecular Energy口袋里的运动侦探豹猫个体识别眼部疾病

小样本优先轻量补丁和先验

当只有少量样本修复已有模型时,冻结主体、训练小 adapter/head、蒸馏旧模型或融合新旧概率,比全量微调更稳。

来源原题:Underfit CVHelp BOBAIMadarian Cow

只有正例时,负样本构造就是核心

图文匹配、检索和对比学习任务如果只给正例,需要人工构造随机负样本,再逐步加入 hard negative。负样本比例、难度和动态重采样比模型深度更关键。

来源原题:图文匹配RestroomScore Off

时序、音频与事件

检测后计数要按计数指标调

如果评分只看数量或事件 IoU,帧级检测 F1 只是辅助。峰值阈值、最小峰间距、NMS 和连续正帧合并要直接对齐最终计数/事件分。

来源原题:Drum Beat CounterSwitchSnapChicken Counting

长音频/长序列可切片预测再汇总

长音频整段训练成本高且样本少。切片训练、片段预测平均、时间平移和裁剪增强能增加样本数;但切分验证必须避免同一原始样本泄漏。

来源原题:MusicArtistAPOAI T2 Audio

短促事件需要时间敏感 pooling

咳嗽、喷嚏、响指、鼓点这类短事件可能被 mean pooling 稀释。max pooling、attention pooling、较小 hop length 和局部差分通常更有效。

来源原题:APOAI T2 AudioSwitchSnapDrum Beat Counter

视觉与空间任务

先定位,再识别或判断动作

当判别信息集中在局部区域时,全图 resize 会稀释细节。先找 ROI、crop 或提取关键点,再做分类/动作检测更稳。

来源原题:SwitchSnap豹猫个体识别眼部疾病Restroom

查询内相对判断优先于独立分类

如果题目给出“四选一异类”“同组匹配”“同 restroom 配对”等结构,推理时要利用组内关系。即使单张分类不准,相似度排序也可能正确。

来源原题:Score OffRestroom

稀疏 mask 任务要调后处理

分割、雷达和像素选择任务中,阈值、连通域、形态学、边界裁剪、保留比例经常决定最终分。像素 accuracy 容易被背景掩盖。

来源原题:Radar At-HomeIndividual RadarWeatherPixel Efficiency

文本与多模态

传统文本基线不可省

TF-IDF、字符 n-gram、LinearSVC/Logistic 往往是短文本和新闻分类的强基线,也能为深度模型提供 sanity check。

来源原题:APOAI Mock Text图文匹配

合成训练到真实测试要重设目标分布

训练分布极偏、测试均衡时,不要按训练比例验证。应构造接近测试目标的验证或至少按 Macro F1、少数类 recall 选参。

来源原题:Language Distribution

符号/图标序列要保留顺序和核心位置

图标提示、emoji、短文本 clue 等任务中,首个符号通常表示核心概念,后续符号用于限定和消歧。文本化或 embedding 检索时不要丢顺序。

来源原题:ChameleonConcepts

先候选生成,再用约束重排

隐藏状态反演、分词、音乐重构、图标提示都可以先生成候选,再用语言模型、词典、乐理或评测代理做重排。候选召回和约束权重都需要调。

来源原题:Mid-Layer InversionWord SegmentationJSB ChoralesConcepts

规则、物理与工程约束

能写规则就不要全交给模型

OCR 日期计算、音乐对位、单摆动力学、分子对称性这类任务有明确规则或方程。模型可以补充感知和噪声鲁棒性,但规则应进入主路径或后处理。

来源原题:ExpiredJSB ChoralesPendulumMolecular Energy

受限运行环境下调资源参数

有时间、内存、参数量、推理耗时限制时,模型大小、输入分辨率、batch size、缓存策略和是否重复加载权重都是超参数。

来源原题:Image Fitting无人机飞控眼部疾病APOAI T2 Audio

提交格式和 id 对齐要单独验

很多题的 0 分风险不是模型,而是列顺序、无表头要求、id 顺序、shape/dtype、文件名、标签反编码或隐藏 lock 流程。写提交前应做格式校验。

来源原题:Drum Beat CounterMid-Layer Inversion眼部疾病图文匹配Radar