ai - rag - 如何选择每段文字的长度?
访问量: 7
1. BGE-M3 对应的输入长度为 8k
vector 一般为1024
我们可以取中文300~600字作为一个语义
原因是300~600字对应的token不超过三千, 三千小于8000
另外,从社区上来看,一段语义基本上是300~600之间,超过600会被稀释, 低于300就稀疏
下面的验证方法来自于AI:
客观的验证方法:
1. 拿同一批 intent + 一组 query。
2. 分别用 300 / 500 / 800 字切分(各带 overlap)。
3. 跑检索,看 命中 top-k 里真正相关段的占比 (recall@k),或直接看 RAG 回答质量。
4. 取那个档位。如果三档差距不大,说明你这批数据的长度对 chunk 不敏感——那随便用哪个都行,不必纠结。