该研究提出面向非天然氨基酸(ncAAs)的相似性增强预训练框架 SinCAA,通过构象相似性引导的对比学习与掩码节点恢复,同时学习 ncAA 之间的功能关系及每种 ncAA 的独特化学身份。SinCAA 在 387,482 种 ncAA 上预训练,能从单个氨基酸结构迁移到完整治疗肽,在 KRAS 宏环肽亲和力、NRAS / KRAS 选择性、环肽细胞通透性及蛋白质-肽结合位点预测等任务中持续优于现有分子预训练模型,并在未见 ncAA、低化学相似度及公共数据向药物研发数据迁移等困难场景中展现出较强的零样本与分布外泛化能力,为含 ncAA 治疗肽的计算筛选和定向优化提供了新的表征基础。