摘 要:[目的/意义] 针对AI4S背景下科研写作面临的通用大模型幻觉与长文本迷失问题,提出融合双库协同RAG的可配置科研写作知识服务框架。[方法/过程] 界定科研写作的三阶段任务,采用“摘要+全文”双知识库协同策略,设计基座模型—系统配置—写作阶段三维评估体系,利用Ragas框架在4个主流大模型上进行全阶段三维评估。[结果/结论] 知识服务框架具备有效性、跨模型适配性;不同写作阶段、不同系统配置的服务效果存在差异,探索阶段的服务效果最优,全功能配置具有最优服务效果、跨模型适配性和跨阶段泛化能力;验证了核心组件可按需配置的有效性和服务效果的可靠性。构建了以“双库协同与两阶段检索”为核心驱动的可配置科研写作知识服务框架。
摘 要: [目的/意义] 本文旨在评估各类关键词表示技术路线的性能差异与场景适配性, 为不同场景下的科研主题识别提供技术选型依据。[方法/过程] 针对不同场景下的学科语境差异, 本文构建了涵盖单一学科、相关学科与跨学科的三类数据集, 选取静态词嵌入、动态词嵌入和无监督图神经网络嵌入三类关键词表示技术路线, 结合 K-Means 实现主题识别, 并通过主题多样性、一致性、稳定性和离散性 4 个维度的评估体系进行系统比较分析。[结果/结论] 静态词嵌入在多样性方面表现突出, 动态词嵌入在一致性和稳定性上优势显著, 无监督图神经网络嵌入则在跨学科语料中展现出良好的区分能力。
摘 要:[目的/意义] 本研究旨在探索大语言模型与科技文献推荐系统融合的新方案,通过构建具有可解释性的科技文献推荐模型,实现双重优化目标:一方面,提升科技文献推荐系统的性能指标;另一方面,增强科技文献推荐结果的可解释性,从而为科技文献服务提供更精准的推荐结果和更具信息量与说服力的解释。[方法/过程] 研究采用正负向对比解释生成策略,在构建基于大模型检索增强的科技文献推荐解释生成框架基础上,结合对比学习、深度神经网络、注意力机制构建科技文献推荐模型,并在 CiteULike 数据集上进行实验验证。[结果/结论] 实验结果表明,本研究构建的推荐模型在 F1 值(0.767)、准确率(0.868)、NDCG@5(0.773)、HR@5(0.832)和 MRR(0.695)评价指标上均优于基线模型。进一步的解释说服力分析和案例分析显示,大模型生成的正负向解释能够有效揭示用户兴趣与候选文献之间的潜在关联和根本差异,这一特性不仅提升了模型性能,还增强了推荐结果的可解释性。本研究证实了大模型检索增强与自适应对比学习相结合在科技文献可解释推荐领域的应用价值,为相关研究提供了新的技术路径和方法论参考。
摘 要:[目的/意义] 技术复杂度作为衡量技术系统内部结构多样性与要素相互依赖程度的核心指标,探究其动态演化机制,有助于从微观层面揭示产业范式变迁的内在逻辑。[方法/过程] 基于中国汽车产业2010—2024年发明专利数据,从技术活跃度、技术年龄与网络中心度3个结构性维度,系统分析两类技术体系中技术复杂度的演化特征及其驱动机制。[结果/结论] 在新兴技术与成熟技术情境下,技术复杂度的演化机制存在系
摘 要:[目的/意义] 技术机会识别是把握科技演进趋势与优化研发布局的关键环节。本文旨在构建一种从技术离群词视角出发的技术机会识别方法,创新性地探索语义边缘的潜在突破点,为捕捉新兴技术方向提供新思路。[方法/过程] 本文基于“技术主题提取—离群词识别—离群词聚类—跨主题聚类语义融合”的逻辑框架,设计了四阶段方法链。首先,利用主题模型对专利文本进行主题识别与主题聚类;其次,通过词嵌入模型生成技术关键词的词向量,结合离群点检测算法与四分位距法识别各技术主题中的离群词;第三,采用聚类算法对离群词进行聚类,并通过文本向量化与语义相似度计算实现跨主题聚类语义融合;最后,基于融合结果,结合“大语言模型+领域专家辅助”的方式,凝练出技术机会方向。[结果/结论] 以“生成式人工智能”领域专利为例进行实证,识别出“基于知识图谱与向量数据库增强的智能问答系统”等5个技术机会,并通过政策比对法与专家一致性评价检验,验证了技术机会识别的合理性与科学性,证明了本方法能有效捕捉潜在技术机会,为企业研发创新与高校科研决策提供决策参考。
摘 要:[目的/意义] 老年人面临着健康信息茧房带来的信息窄化、认知固化等问题,对老年人健康信息茧房影响因素及关联路径进行研究,有助于提出针对老年人的破茧对策。[方法/过程] 通过扎根理论挖掘老年人在线健康信息茧房形成的影响因素,并借助 ISM—MICMAC 模型分析因素间的作用路径和层次关系,识别关键影响因素。[结果/结论] 老年人认知状况下降、健康需求固化、健康信息素养较低、社交趋同及应用程序
摘 要:[目的/意义] 聊天机器人作为在线健康社区中新型医疗服务载体,探究具体拟人化风格和凝视方向对患者用户依从的影响,对优化在线健康社区中的聊天机器人设计、提升公众健康管理水平具有参考意义。[方法/过程] 本文设计了3个情景实验,在线招募被试完成各实验后填写调查问卷,运用方差分析、Bootstrap等方法检验拟人化特征的内在影响机制与边界条件。[结果/结论] 聊天机器人拟人化风格对患者用户依从的
摘 要:[目的/意义] 随着互联网经济的快速发展,短视频平台异军突起,用户规模不断增长,为提升用户体验,个性化的视频推荐算法需要不断优化,而用户视频时长偏好作为用户观看行为的一项重要指标,能够反映短视频场景下用户异质性与差异化需求,因此本文旨在通过引入视频时长偏好来改进传统推荐模型,以提升短视频推荐效果。[方法/过程] 本文在偏差奇异值分解(BiasSVD)模型的基础上,引入用户视频时长偏好与时长敏感度因素,构建融合视频时长偏好特征的改进矩阵分解推荐算法(DASVD),实验选取KuaiRand-1k全曝光数据集作为研究对象,将所提出的DASVD模型与多种基准推荐算法进行对比分析。[结果/结论] 实验结果表明,与其他模型相比,DASVD的短视频推荐评分预测误差较小,并且在Top-N推荐任务中能够显著提升排序性能,将视频时长偏好引入短视频个性化推荐有助于优化推荐算法,缓解用户信息过载。
摘 要:[目的/意义] 随着数字文献数量的指数级增长,数字学术阅读已成为本科阶段学生知识获取的核心途径之一。然而不同的数字阅读导航方式可能对学生的知识获取效率和理解深度产生影响。因此,本研究通过比较两种导航模式在支持本科学生完成查找型任务和理解型任务时的效果差异,为优化数字学术平台阅读导航设计、深化大学生信息素养教育提供实证依据。[方法/过程] 基于结构导航与信息单元导航搭建INFO—STR和INFO—UNIT两个学术阅读导航平台,进行实验。[结果/结论] 实验结果表明,在查找型任务中,两者任务完成时间、任务得分、导航使用次数均无显著差异,而在理解型任务中,信息单元导航因提供了更细粒度的知识而在上述3个指标以及导航有用性上表现更优。实验证明了信息单元是一种全新的导航组织思路,也为数字阅读导航系统设计和信息素养教育改革提供启示。
摘 要:[目的/意义] 个人数据作为数据要素的重要组成部分,其价值释放路径面临利用效率与个人权益保护之间的突出矛盾。韩国 MyData 模式为协调个人数据流通与权利保障提供了有效路径,对中国构建数据要素市场体系具有重要的参考意义。[方法/过程] 本研究基于个人数据价值化相关理论基础及现状,系统分析韩国 MyData 模式的制度基础、“五元主体”治理框架以及“权属确认—安全流通—价值实现”闭环路径,分析其以数据可携权为法律基础、标准化 API 接口为交易手段、隐私计算技术为安全支撑的体系化运作模式。[结果/结论] 韩国 MyData 模式通过制度、市场和技术的系统协同,构建了个人数据授权使用、可信流通与合理收益分配的一体化机制,为平衡数据利用与隐私保护提供了可操作范式。为中国构建“权利分置—协同治理”的个人数据价值转化体系提供制度保障与实践路径参考。
摘 要:[目的/意义] 为深入揭示数据基础设施对战略性产业集群协同演进的内在驱动机制,推动区域数字基础设施建设、促进产业集群高质量发展提供理论依据与实践参考。[方法/过程] 基于2011—2023年广东省时间序列数据,构建偏最小二乘结构方程模型,系统检验数据基础设施通过“数据要素化水平—创新要素配置效率”链式中介路径对产业集群协同演进的驱动作用,并对其直接与间接影响路径进行实证分析。[结果/结论]
摘 要:[目的/意义] 针对跨机构数据融合面临的数据主权让渡风险、特征异构稀疏以及隐私保护不足等问题,提出一种融合纵向联邦学习与大模型增强的跨机构数据融合优化模型(VFL-LBDA-DFOM),旨在保障数据隐私的前提下提升跨机构数据融合的效用与安全性。[方法/过程] 首先,基于纵向联邦学习框架确保各机构原始数据在不出本地的前提下实现特征联合建模;其次,引入DeepSeek-V3大模型对本地稀疏特征进行生成式补全,以缓解特征稀疏与长尾分布问题;最后,将差分隐私随机梯度下降算法嵌入联邦训练过程,通过动态梯度裁剪、自适应噪声注入及隐私预算衰减策略,实现对梯度泄露风险的控制。仿真实验场景以中药领域为例,采用BERT-BiLSTM-CRF作为本地分类模型。[结果/结论] 结果表明,VFL-LBDA-DFOM在F1值和AUC上分别达到0.810和0.843,优于所有隐私约束条件下的基线模型,验证了跨机构数据融合优化的有效性。大模型数据增强模块对低资源类别建模效果提升显著,差分隐私优化机制能在分类精度与隐私保护间实现平衡,且存在最优扰动区间。进一步研究发现,过高噪声虽增强隐私保护,但会压制模型泛化能力。
摘 要:[目的/意义] 面向临床科研场景下,电子病历数据质量治理中全链条规划、多源“孤岛数据”整合,以及数据结构化、标准化过程中的准确性与可溯源性等问题,构建电子病历数据质量治理路径,探索高质量科研数据集建设方案。[方法/过程] 以吉林省某三甲医院真实世界数据应用平台为案例,进行电子病历数据质量治理实践剖析。通过焦点小组访谈,引导受访者对电子病历数据质量治理展开互动式讨论;利用主题分析法对访谈资料进行编码,系统识别并归纳出在数据质量治理中的问题;采用理论分析法,基于PDCA循环理论构建临床科研场景下电子病历数据质量治理路径,实现从“问题识别”到“治理闭环”的逻辑衔接。[结果/结论] 研究融合临床科研工作需求,以科研数据生命周期视角为切入点,提出临床科研场景下电子病历数据质量治理策略,形成了“规划引导—采集整合—处理转化—安全存储—共享应用—反馈优化”的闭环治理路径。
摘 要:[目的/意义] 临床决策亟须医学知识图谱对“对称—反对称—组合”等复杂关系的精准推理,传统嵌入模型因缺乏双向语义校验而出现关系断裂与方向失真,难以支撑高可信辅助诊断。系统提升模型对复杂关系的双向一致建模能力,既是突破医学图谱推理瓶颈的切口,也可为构建可解释、可复用的智慧医疗体系提供理论支撑与实践路径。[方法/过程] 本文遵循“理论缺陷—模型改进—临床验证”的研究逻辑,首次将循环一致性原理引入RotatE,提出MedCycle-RotatE:在复数旋转空间中显式施加正向—反向循环一致约束,量化头尾实体经逆关系重建后的语义偏差,并以旋转损失联合循环一致性损失进行端到端优化,实现复杂临床关系的稳健推理。[结果/结论] DiseaseKG与BIOS两大医学图谱的实验表明,MedCycle-RotatE的MRR达到0.800,Hit@10达到84.7%,显著优于TransE、RotatE、DistMult等主流模型。消融实验显示,完整循环一致性约束使MRR进一步提升至0.855,收敛轮次减少90轮。结果证实,循环一致性与旋转嵌入的耦合可大幅压缩语义误差,为临床关系推理提供高一致、可解释的新范式。