首页

当前位置是: 首页 -> 重要新闻 -> 正文

徐世荣助理教授近期连续在JASA、JRSSB、Biometrika发表论文

作者: 发布时间:2026-09-02

    近日,王亚南经济研究院、经济学院统计学与数据科学系徐世荣助理教授在统计学理论方法领域接连产出高质量成果,相继在Journal of the American Statistical Association(JASA)、Journal of the Royal Statistical Society Series B: Statistical Methodology(JRSSB)和Biometrika在线发表三篇学术论文。上述三刊与Annals of Statistics并称统计学国际“四大刊”,是学界公认的统计学国际顶尖期刊,均为厦门大学经济学科认定的国际A类期刊。

首先,由徐世荣担任第一作者,与中国科学技术大学管理学院张靖南教授、香港中文大学王军辉教授合作完成的论文“When Less Is More: Binary Feedback Can Outperform Ordinal Comparisons in Ranking Recovery”在JASATheory & Methods)在线发表。

 

文章简介:配对比较数据是指用户以成对方式对项目进行评价的一类数据,在排序与偏好学习任务中具有重要应用。尽管从直觉上看,序数比较数据所携带的信息似乎比二元比较数据更为丰富,但本文对这一传统认识提出了质疑。本文针对无平局情形下的序数配对比较数据,提出了一个一般性的参数化建模框架:模型采用广义加性结构,其中链接函数用以刻画两项目之间的偏好差异,模式函数则控制序数响应在不同等级上的概率分布。值得注意的是,通过将二元响应视为序数响应“二值化”后的结果,该框架自然地将经典的二元比较模型纳入作为其特殊情形。本文证明:在该框架下,对序数数据进行二值化能够显著提高排序恢复的准确性。具体而言,在计数算法下,基于二元比较数据得到的排序误差具有比直接使用序数数据更快的指数收敛速度。本文还进一步从信噪比(SNR)的视角刻画了二元数据与序数数据之间的显著性能差距,并找出了使SNR最小、从而使二值化收益最大的模式函数。大量模拟实验以及基于MovieLens数据集的真实数据分析均验证了上述理论结果。

此外,由徐世荣担任共同第一作者、加州大学洛杉矶分校UCLA)的何珩之博士、程光教授合作完成的论文“Recursive Learning without Collapse: A Weighting-based Stabilization Framework”在JRSSB在线发表。

 

文章简介:在生成模型的递归训练过程中存在一种值得关注的现象——“模型坍塌”(model collapse),即当模型使用前一轮自身生成的数据进行再训练时,其性能可能出现严重退化。如何解决这一问题并设计更有效的训练策略,已成为当前生成模型研究中的一个关键挑战。本文在一个新的框架下研究模型坍塌现象:在该框架下,生成模型以迭代方式训练,每一步所用数据由新收集的真实数据与上一轮模型生成的合成数据共同组成。为了寻找整合真实数据与合成数据的最优训练策略,本文研究了一类加权训练方法,并在多种典型统计模型下分析其性能,包括高斯分布估计、广义线性模型以及非参数估计。本文从理论上刻画了合成数据的混合比例及相应的加权方式对最终模型性能的影响。其主要发现是:在不同模型设定下,对于不同的合成数据比例,其渐近最优加权方案都遵循一个统一的表达形式,揭示了利用合成数据与维持模型性能之间存在的基本权衡。在某些情形下,真实数据对应的最优权重恰好等于黄金比例的倒数。大量模拟实验与一项真实表格型数据集分析进一步验证了上述理论结果。

与此同时,由徐世荣担任通讯作者,与加州大学洛杉矶分校UCLA)的何珩之博士、李冀平博士、程光教授以及美国凯斯西储大学(Case Western Reserve University)的Alexander Nemecek博士Erman Ayday副教授合作完成的论文“Optimal Watermark Generation under Type I and Type II Errors”在Biometrika在线发表。

 

文章简介:近年来,水印技术已成为保护生成模型知识产权、区分人工智能生成内容与人类生成数据的重要工具。然而,现有多数水印方案主要依赖经验设计,对于检测能力与生成保真度之间的基本权衡仍缺乏系统的理论理解。本文将水印问题表述为原始分布与其水印分布之间的统计假设检验问题,在对假阳性率与假阴性率施加明确约束的条件下,推导了以一般 f-散度度量的可实现保真度损失的一个紧致下界,并刻画了能够达到该下界的最优水印分布。在此基础上,本文进一步构造了与该最优分布相对应的采样规则,给出了一种在最小化保真度失真的同时嵌入水印的最优机制。本文的结果建立了一个简单但具有广泛适用性的基本原理,将假设检验、信息散度与水印生成三者有机联系起来。

徐世荣,香港城市大学博士,现为厦门大学王亚南经济研究院、经济学院统计学与数据科学系助理教授。主要从事排序与数据聚合、网络数据分析及机器学习等方面的研究,重点关注复杂数据环境下的可靠结构恢复与统计推断问题,包括多源数据融合、排序推断、隐私保护、社区发现及潜在结构学习等。相关研究成果发表于国际统计学期刊JRSSB、JASA、Biometrika、JBES等,主持国家自然科学基金青年项目1项。

 

(经济学院  刘晨宇)

TOP