3800.
大语言模型(large language model, LLM)在自然语言理解与生成领域展现出卓越能力, 但在特定领域知识密集型任务中仍面临事实准确性不足、知识更新难以及高质量领域数据集匮乏的问题. 在应对上述难题时, 检索增强生成(retrieval-augmented generation, RAG)技术脱颖而出, 成为行之有效的解决路径. 然而, 在应对碳领域的知识密集型任务时, RAG技术还存在查询理解环节容易出现偏差、外部知识检索策略僵化单一、检索得到的结果与实际需求的相关性较差等短板, 同时缺乏特定的数据集来评估问答效果. 针对以上问题, 提出基于多管道的检索增强生成(Multi-pipeline-based RAG)方法, 使用本文提出的图谱增强递归式智能合并检索, 有效提升了检索精确率; 针对特定领域问答数据集的缺乏, 提出基于父节点文本的大模型自动生成问答数据集方法. 同时在传统评估指标, 如精确率(
Precision)、召回率(
Recall)等基础上, 利用LLM的文本理解能力评估: (1)响应-上下文-查询相关性评估; (2)响应-查询相关性评估; (3)上下文-查询相关性评估; (4)忠诚性评估. 通过与BM25-based RAG、Vector-based RAG、Recursive-based RAG的对比实验, 基于GLM-4-Plus模型的Multi-pipeline-based RAG精确率达到了85%, 高于其他方法.… …
相似文献