文献追踪日报

2026年9月10日

今日检索概况

主题检索期刊收录论文数
AI大模型JASIST、Computational Linguistics、Scientometrics6
供应链金融Journal of Risk and Insurance、Transportation Research Part A、Computers & Operations Research3
品牌The Service Industries Journal、Electronic Commerce Research、Telematics and Informatics3
合计9本12篇

注:AI大模型主题检索期刊为 Journal of the Association for Information Science and Technology(JASIST,SSCI 1-2区)、Computational Linguistics(SCIE 1区,ACL 旗舰)、Scientometrics(SSCI 2区);供应链金融主题为 Journal of Risk and Insurance(FT50/保险类顶刊)、Transportation Research Part A(SSCI 1-2区)、Computers & Operations Research(SCIE 2区);品牌主题为 The Service Industries Journal(SSCI 2区)、Electronic Commerce Research(SSCI 2区)、Telematics and Informatics(SSCI 1-2区)。主题相关性已人工筛选,个别文献属该刊广义相关方向。

AI大模型 检索期刊:JASIST、Computational Linguistics、Scientometrics
#1 · AI大模型
复杂提问与高质量回答:比较 ChatGPT 与 Gemini 作为研究合作者的表现
[1] Ravuri B, Mardis M A, Moja O, Ayinde L, Emdad F B. Complex questions and quality answers: Comparing ChatGPT and Gemini as research collaborators[J]. Journal of the Association for Information Science and Technology, 2026, 77(6): 795-811.
一句话概括

以84个真实图书馆参考咨询问题比较 ChatGPT 4o-mini 与 Gemini 1.5 Flash 的回答质量,发现问题复杂度会影响机器人提供进一步协助的意愿;与 ChatGPT 相比,Gemini 对不同类型问题的回答完整性更稳定、质量更高。

摘要

人工智能聊天机器人日益流行,但如何处理复杂问题、以及问题复杂度对其回答质量的影响仍研究不足。本研究考察 ChatGPT 与 Gemini 等聊天机器人能否就用户提问给出高质量回答。为判断大语言模型是否提供了准确、完整的回答与进一步协助,并覆盖不同难度和类型的问题,作者用 ChatGPT 4o-mini 和 Gemini 1.5 Flash 分析了84个复杂度与类型各异的真实图书馆参考咨询问题。分析显示,问题复杂度(READ)水平与“进一步协助”之间存在强且显著的关联:ChatGPT 4o-mini 在复杂度上升时会提供更多资源,但仍无法给出完整回答;Gemini 1.5 Flash 则表现出问题类型与回答完整性之间的显著关联。作者据此认为,与 ChatGPT 4o-mini 相比,Gemini 1.5 Flash 对所有问题类型都更敏感,能提供更稳定一致的高质量回答。鉴于大语言模型持续迭代,本研究使用的是 ChatGPT 4o-mini 与 Gemini 1.5 Flash,未来研究应采用比较法评估更新的模型和人类回答。

#2 · AI大模型
会跳舞的熊、同事,还是一把更锋利的工具箱?数字人文研究中生成式人工智能技术的谨慎采用
[2] Ma R, Dedema M, Cox A. A dancing bear, a colleague, or a sharpened toolbox? The cautious adoption of generative artificial intelligence technologies in digital humanities research[J]. Journal of the Association for Information Science and Technology, 2026, 77(6): 812-830.
一句话概括

基于76名受访者的国际调查与15个深度访谈,揭示数字人文学者对生成式AI“既提升效率又威胁学术身份”的矛盾心态:GenAI 正被渐进式纳入 DH 研究网络,重塑人与非人行动者之间的关系,且这一过程仍充满争议。

摘要

生成式人工智能(GenAI)的出现正在重塑研究生态,对长期与计算方法和技术紧密交织的数字人文(DH)领域产生深远影响。本研究考察数字人文学者如何在研究中采用并批判性评估 GenAI。基于面向76名受访者的国际调查和15个深度访谈,作者探究了学者使用 GenAI 工具的动机、将其整合进研究的具体实践,以及他们对 GenAI 收益、风险与挑战的感知。研究发现 DH 社群内部存在分歧与不同想象:许多学者将 GenAI 视为提升效率、支撑技能重塑的手段,另一些学者则担忧它对学术身份、智力劳动和学科价值观的影响。置于 DH 发展史背景并经行动者网络理论分析,结果表明 GenAI 正被渐进式纳入 DH 研究网络,在持续争议与协商中重塑人与非人行动者之间的关系。作为该主题最早的经验研究之一,本文为理解 GenAI 在数字人文研究中的影响奠定了初步基础。

#3 · AI大模型
真相还是海市蜃楼?基于 LLM-Oasis 的端到端事实性评估
[3] Scirè A, Bejgu A S, Tedeschi S, Ghonim K, Martelli F, Navigli R. Truth or mirage? Towards end-to-end factuality evaluation with LLM-Oasis[J]. Computational Linguistics, 2026, 52(1): 1-41.
一句话概括

提出迄今最大的端到端事实性评估资源 LLM-Oasis:从维基百科抽取主张并构造事实/非事实文本对,经人工校验后训练幻觉检测器;结果显示即便最强的 GPT-4o 在此任务上的准确率也仅约60%,幻觉仍是开放难题。

摘要

在大语言模型(LLM)出现后,文本摘要、机器翻译等自然语言生成(NLG)任务的性能大幅提升;然而 LLM 仍会产生包含幻觉的输出,这严重制约其在医疗、法律等高风险场景的应用。为训练可靠的端到端事实性评估器,本文构建了 LLM-Oasis——据我们所知迄今最大的端到端事实性评估训练资源。该数据集从维基百科抽取主张、对其中一部分进行捏造篡改,并生成事实与非事实的文本对;继而依靠人工标注者验证数据质量并构建金标准测试集。在评测中,作者对一组主流大语言模型进行端到端事实性评估,结果显示即便是最强的模型(如 GPT-4o)其准确率也仅达到约60%,说明大语言模型的幻觉检测与事实性评估仍是亟待攻克的关键问题。

#4 · AI大模型
大语言模型与文化价值观:提示语言与显性文化框架的影响
[4] Bulté B, Rigouts Terryn A. LLMs and cultural values: The impact of prompt language and explicit cultural framing[J]. Computational Linguistics, 2026, 52(2): 407-494.
一句话概括

用霍夫斯泰德价值观与世界价值观调查的63个题项(译为11种语言、配以有无显性文化视角的提示)探测10个大语言模型,发现提示语言与文化框架虽能部分引导回答,但无法克服模型对荷兰、德国、美国、日本等国价值观的系统性偏向。

摘要

大语言模型正被全球用户迅速采用,用户以多种语言与模型交互;与此同时,该技术在训练数据与优化目标上存在公认的不平衡,令人质疑 LLM 能否准确代表其广泛用户群体的文化多样性。本研究聚焦 LLM 与文化价值观,考察提示语言与文化框架如何影响模型回答及其与不同国家人类价值观的一致性。作者以霍夫斯泰德价值观调查模块和世界价值观调查中的63个题项探测10个 LLM,将题项译为11种语言,并分别以带/不带不同显性文化视角的提示进行提问。研究证实,提示语言与文化视角都会使 LLM 输出产生变异,但存在一个重要限定:定向提示虽能在一定程度上将 LLM 回答引向相应国家的主流价值观,却无法克服模型对本数据集中少数国家(荷兰、德国、美国、日本)价值观的系统性偏向。所有被测模型,无论来源如何,都表现出惊人相似的模式,说明文化偏差是当前 LLM 面临的普遍性问题。

#5 · AI大模型
大语言模型时代的 AI 研究质量评价:优势、劣势与系统性影响(观点文章)
[5] Thelwall M. Research quality evaluation by AI in the era of large language models: advantages, disadvantages, and systemic effects[J]. Scientometrics, 2025, 130(10): 5309-5321.
一句话概括

观点文章审视以 ChatGPT 为代表的 AI 生成研究质量评价对文献计量学的冲击:LLM 在准确率与覆盖率等多数维度已等同甚至超越文献计量指标,但其偏差尚不可知、透明度低于引文计数,引入此类指标需警惕系统性影响。

摘要

以 ChatGPT 为代表的人工智能技术如今正威胁文献计量学作为研究质量指标主要生成者的地位——它们至少已被一个研究质量评价系统采用,且有证据表明许多同行评审者正非正式地使用它们。由于以文献计量支撑研究评价本就存在争议,本文回顾了 AI 生成质量分数的相应优势与劣势。从技术角度看,基于大语言模型的生成式 AI 在多数重要维度上与文献计量学相当甚至更优,包括准确率(与人评分的相关性通常更高)和覆盖率(覆盖更多学科、更多近期的成果),并可能反映更多研究质量维度;但同文献计量学一样,当前 LLM 并不真正“测量”研究质量。在明显劣势方面,LLM 用于研究评价时的偏差目前未知,其分数也不如引文计数透明。从系统性视角看,关键问题在于将基于 LLM 的指标引入研究评价体系后可能产生的系统性影响。

#6 · AI大模型
观点文章:生成式 AI 与科学计量学的未来
[6] Lepori B, Andersen J P, Donnay K. Opinion paper: generative AI and the future of scientometrics[J]. Scientometrics, 2026, 131(7): 4307-4325.
一句话概括

本文主张科学计量学应从对生成式 AI“试错式”的使用转向可解释、可行动化的应用,这要求对 GenAI 的优势与局限有原则性的理解,并据此讨论了生成式 AI 给科学计量学带来的研究主题与未来问题。

摘要

本文旨在为科学计量学中关于生成式人工智能(GenAI)的讨论做出贡献。作者认为,要从对 GenAI“试错式”的使用转向可解释、可行动化的应用,需要对 GenAI 的优势与局限建立原则性的理解。文章进一步探讨了生成式 AI 可能重塑科学计量学概念基础与研究议程的方式:随着 AI 越来越多地介入数据采集、主题识别与科学研究评估,学科的传统工具与方法论基础正面临变革。基于此,作者归纳了当前议题与未来研究问题,为科学计量学在生成式 AI 时代的发展提供了方向性思考。

供应链金融 检索期刊:Journal of Risk and Insurance、Transportation Research Part A、Computers & Operations Research
#7 · 供应链金融
AI 时代的船舶保险:POM 原则下的智能风险画像系统
[7] Yu F, Zhang M, Li Z, Yang M. Ship insurance in the era of AI: an intelligent risk profiling system under the POM principles[J]. Journal of Risk and Insurance, 2026, 93(1): 92-117.
一句话概括

针对传统船舶保险风险画像与频率-严重度定价错位、难以容纳复杂风险因子、缺乏数据流调整机制三大缺陷,提出 POM 原则与三核 AI 框架,用中国2016–2021年登记船舶的15007条记录(15%)验证,随机森林回归在准确率与风险区分度上优于传统广义线性模型及主流机器学习模型。

摘要

作为现代商业保险的起源,船舶保险支撑着全球海运供应链的稳定。然而航运现代化与 AI 的进步暴露出传统风险画像的三大缺陷:与频率-严重度定价错位、难以容纳复杂风险因子体系、缺乏数据流调整机制。为此,作者提出 POM 原则(个性化风险画像 Personalized risk portrait、全维风险因子 Omnispective risk factors、可操控校准 Maneuverable calibration)以及一个以三大核心为支撑的 AI 框架:(1)可扩展的“回顾+前瞻”风险因子;(2)用于费率/保额预测的独立 AI 模块;(3)基于历史数据的数据流校准机制。研究基于中国2016–2021年登记的15007条船舶记录(占15%)使用随机森林回归验证,结果显示该方法在准确率与风险区分度上均优于传统广义线性模型和主流机器学习模型。本文开创了智能船舶保险画像研究,填补了个体化定价的空白,其“费率×保额”逻辑可为航空保险等领域提供借鉴。

#8 · 供应链金融
可持续海运供应链框架:面向学术界与实践者的综述
[8] Jafarian A, Dolati Neghabadi P, Asgari N, Zanjirani Farahani R. A sustainable maritime supply chain framework: an overview for academics and practitioners[J]. Transportation Research Part A: Policy and Practice, 2026, 205: 104863.
一句话概括

系统综述海运运输、可持续供应链与海运供应链(MSC)相关文献,构建按供应链规划特征、关键海运利益相关者与可持续性维度分类的集成框架,为货运、港口与航运等环节的可持续评估在监管要求与产业实践之间架起桥梁。

摘要

海运运输承担了全球80%以上的贸易量,主要归因于其成本效率。随着全球供应链演进,可持续性已成为海运部门的关键关切。本研究回顾了海运运输、可持续供应链与海运供应链(MSC)中最相关的论文,旨在通过开发集成分类框架推动该领域发展。所提出的框架依据供应链规划特征、关键海运利益相关者与可持续性维度对既有学术研究进行系统分类。作者首先分析 MSC 网络,聚焦港口、航运公司与海运物流服务商等结构组成及其相互联系;继而考察 MSC 规划问题,强调在时间跨度、产品/服务类型与地理三个核心维度上的决策与优化挑战;随后探讨利益相关者间的互动,揭示其协作与竞争动态如何影响可持续结果。该框架能对海运物流的可持续性进行结构化评估,在监管要求与产业实际应用之间搭建桥梁,为学术研究与实践者提供统一的分析工具。

#9 · 供应链金融
绿色地平线:动态供应链管理中的可持续全球物流
[9] Mohammadi M, Mohamadpour Tosarkani B. Green horizons: sustainable global logistics in dynamic supply chain management[J]. Computers & Operations Research, 2026, 185: 107226.
一句话概括

提出纳入对冲策略的多阶段随机-动态全球供应链模型,并设计加速并行随机对偶动态整数规划(SDDiP)算法以应对需求波动、中断与提前期等动态因素;数值实验表明所提策略持续优于基本随机对偶动态规划等基准方法,增强供应链韧性。

摘要

全球范围内的供应链管理需要应对大量不确定性,从需求波动到难以预见的中断。开发先进的求解方法对于管理此类复杂性并确保韧性至关重要。本研究提出一个纳入对冲策略的全球供应链多阶段随机-动态模型,目标是在各仓库(原材料与成品)之间确定物料清单的最优订货排程、生产计划与库存管理。鉴于全球供应链的动态特性(如需求波动、中断与提前期),作者构建了用于随机-动态供应链网络的多阶段随机模型。为应对真实全球供应链的动态因素,提出一种加速的并行随机对偶动态整数规划(SDDiP)方法,以处理政治动荡、自然灾害与大流行病等中断,从而增强供应链韧性。为验证所提出的并行 SDDiP,作者用案例生成了不同规模的多种情景,并将其与采用 Benders 割和集成阶段拉格朗日对偶割(SDDiP-SWLDC)的方法进行比较。结果显示,所提出的并行节点加速 SDDiP 策略持续优于基本随机对偶动态规划(SDDP),并在韧性和计算效率上表现出明显优势。

品牌 检索期刊:The Service Industries Journal、Electronic Commerce Research、Telematics and Informatics
#10 · 品牌
在服务情境中激发消费者参与、体验与价值共创以培育基于消费者的品牌资产:感知健康信念的调节作用
[10] Satar M S, Rather R A, Parrey S H, Khan H, Rasul T. Eliciting consumer engagement, experience, and value co-creation to foster consumer based-brand-equity in service context: moderation of perceived-health-beliefs[J]. The Service Industries Journal, 2025, 45(2): 277-302.
一句话概括

基于服务主导逻辑与保护动机理论,以318名旅游服务消费者为样本验证:消费者品牌参与(CBE)正向影响价值共创(CVC)与品牌体验(CBX),CBX 进而提升情感依恋与基于消费者的品牌资产(CBBE),且路径受感知严重性(负向)与自我效能感(正向)调节。

摘要

尽管消费者品牌参与(CBE)与消费者品牌体验(CBX)被列为重要的研究优先事项,但关于它们与旅游消费者所产生的价值共创(CVC)、情感依恋以及基于消费者的品牌资产(CBBE)之间关系的经验证据仍然不足,特别是在 COVID-19 疫情期间。针对这一研究缺口,本文依据服务主导逻辑与保护动机理论,提出并检验了一个探究 CBE 与 CVC 对 CBX 影响、进而影响旅游服务品牌情感依恋与 CBBE 的模型。作者以318名消费者为样本,采用 PLS-SEM 进行分析。结果表明:首先,CBE 对 CVC 与 CBX 均有正向影响;其次,CBX 对情感依恋与 CBBE 有正向影响;第三,结果证实 CBE 与 CVC 经由 CBX 的中介对情感依恋和 CBBE 产生间接效应;最后,研究发现感知严重性对路径起负向调节作用,而自我效能感起正向调节作用。本文为旅游服务品牌的消费者参与、体验与品牌资产管理提供了重要的理论与实践启示。

#11 · 品牌
借拟人化品牌逃离现实:考察拟人化品牌在促进持续参与中的作用
[11] Singh D, Kunja S R. Escaping the reality with humanized brands: examining the role of anthropomorphized brands in fostering continued engagement[J]. Electronic Commerce Research, 2026, 26(2): 1071-1090.
一句话概括

从480名年轻消费者数据出发,发现品牌拟人化与持续参与之间存在显著正相关,且该关系依次由沉浸感与逃避现实所中介;研究整合并扩展了社会交换、心流与应对理论,为营销者提供了情感联结与沉浸式环境价值的实践洞见。

摘要

在当今科技驱动的时代,压力水平不断上升,消费者越来越多地将在线浏览与购物作为逃避和应对现实的一种方式。这种行为的转变为品牌提供了一个长期留住消费者的机会。本研究概念化了品牌利用这一机会的路径——通过建立人际化消费者-品牌关系与沉浸式环境来保持持续的参与。为实证检验该框架,研究者从年轻消费者(N=480)中收集数据。结果显示,品牌拟人化与持续参与之间存在积极且显著的关系,且这种关系依次由沉浸感与逃避现实所中介。研究还整合并扩展了社会交换、心流与应对理论,为营销人员提供了关于情感联结和沉浸式环境在推动持续参与方面重要性的实用见解,尤其在服装零售电商品牌场景下回应了年轻消费者对品牌关怀与沉浸体验的需求。

#12 · 品牌
虚拟影响者,虚拟设计?——虚拟影响者实验研究的系统综述
[12] Vranken S, Kaňková J, Matthes J. Artificial influencers, artificial designs? A systematic review of experimental research on virtual influencers[J]. Telematics and Informatics, 2025, 102: 102327.
一句话概括

对157个虚拟影响者实验进行预注册系统综述,发现多数研究检验的是披露效应而非核心说服特征,存在生态效度隐忧;据此讨论方法论启示并提出更具生态效度的实验设计方向。

摘要

随着 AI 技术的快速演进,社交媒体领域涌现出一种新的影响者类型——虚拟影响者(VIs)。这些数字创造的个体在推广产品、品牌、观点与行为方面已被证明非常有效。迄今为止,研究已揭示了虚拟影响者的独特特征与效果,但仍缺乏对其实验设计的系统讨论,而实验设计恰是理解 VIs 有效性的关键方法。在一项对 N=157 个实验的预注册系统综述中,作者考察了这些研究如何设计、测量哪些效应,以及涉及的主要调节与中介变量。研究发现,大多数研究检验的是披露效应而非虚拟影响者的核心说服特征,这引发了对生态效度的担忧。文章讨论了相关方法论启示,并为更具生态效度的实验设计提出了建议方向,为品牌与营销领域评估虚拟影响者的传播效果提供了参考。