基于 BiLSTM+Attention、Transformer 与 BERT 多架构对比,在 TNEWS 15 类新闻数据集上实现 54.36% Val Macro-F1,深入探索多粒度分词、预训练模型微调、数据增强与集成学习。
双向 LSTM 编码器捕获前后文语义,加性注意力机制动态聚焦关键位置。2 层 BiLSTM(hidden=256)+ Attention(dim=128)+ 双层分类头。
4 层 Encoder(d_model=512, 8 heads),正弦位置编码 + Multi-Head Self-Attention + FFN + LayerNorm,Global Average Pooling 输出。
| 模型 | 分词方式 | Val Acc | Val Macro-F1 | Best Epoch |
|---|---|---|---|---|
| BiLSTM+Attention | Char |
0.4999 | 0.4833 ★ | 6 |
| BiLSTM+Attention | Word |
0.4683 | 0.4579 | 5 |
| Transformer | Char v1 lr=5e-4 |
0.1094 | 0.0131 | — |
| Transformer | Char v2 lr=1e-3 |
0.4404 | 0.4093 | 4 |
| Transformer | Word |
0.4675 | 0.4222 | 3 |
| Transformer | Subword |
0.1094 | 0.0131 | — |
短文本(平均 22 字符)上,BiLSTM 的循环结构更适合捕获短距离依赖。Transformer 参数量大(15.2M vs 4.8M),在小数据集上容易过拟合。Transformer 对学习率极度敏感,需要 warmup 才能正常训练。
字符级分词 Macro-F1 比词级高 2.5 个百分点。短文本中 Char-level 保留更多细粒度信息,而 jieba 分词容易引入切分错误(如"上课时"→"上课/时"),破坏完整语义单元。