ai - rag - 如何选择每段文字的长度?

访问量: 7

1.  BGE-M3 对应的输入长度为 8k

vector 一般为1024

我们可以取中文300~600字作为一个语义

原因是300~600字对应的token不超过三千,   三千小于8000

另外,从社区上来看,一段语义基本上是300~600之间,超过600会被稀释, 低于300就稀疏

下面的验证方法来自于AI:

客观的验证方法:

1. 拿同一批 intent + 一组 query。
2. 分别用 300 / 500 / 800 字切分(各带 overlap)。
3. 跑检索,看 命中 top-k 里真正相关段的占比 (recall@k),或直接看 RAG 回答质量。
4. 取那个档位。如果三档差距不大,说明你这批数据的长度对 chunk 不敏感——那随便用哪个都行,不必纠结。

订阅/RSS Feed

Subscribe