大半夜给ai摆了一手

2026-08-26
#11
回复 10# zezezeze123
不是你理解的这样比如1.2TB参数A13B一次性激活是13B Moe是推理权重而剩下的是知识模型
换句话说就是把数据压缩写入权重里面强行撑大参数数量罢了推理能力还是和弱智一样没区别
RAG这个技术当时就是为了解决这个问题,但是缺陷非常多被淘汰了所以改成知识推理权重一体
但是要解决这个问题也很简单,那就是工程化模型分离
知识权重和推理模型分别训练2个 1+1>2的效果,垂直领域深度推理速度都是完虐线上所有模型的
也不像你说的一定要人工去补知识权重是死的可以直接蒸馏大模型的直接从开源模型里面剪裁出来定制