摘要智能能合约漏洞检测数据集包含数千个 Solidity 源代码片段3 个特征source_code、label_encoded0-7、binary_label0 安全/1 易受攻击涵盖 7 种漏洞类型重入、整数溢出、访问控制等专为 NLP 二元分类和 DeFi 安全研究设计。数据集简介数据集概述数据集包含 3 个主要特征(1) source_code智能合约的原始 Solidity 源代码以太坊智能合约编程语言(2) label_encoded表示特定漏洞类别的整数例如0 表示安全1-7 表示不同的漏洞类型如重入漏洞、整数溢出漏洞、访问控制漏洞等(3) binary_label派生目标值其中 0 表示安全1 表示易受攻击用于二元分类任务。漏洞类型示例重入漏洞Reentrancy、整数溢出漏洞Integer Overflow、访问控制漏洞Access Control等共 7 种漏洞类型 1 种安全类别。数据集适用于 NLP 技术包括词级和字符级 TF-IDF 向量化、语法和逻辑模式识别。支持智能合约安全漏洞自动检测、二元分类安全 vs 易受攻击、多类别分类8 类、NLP 代码分析、TF-IDF 向量化、机器学习/深度学习模型训练LSTM、Transformer、CodeBERT、DeFi 安全、区块链安全、静态代码分析和安全审计自动化。数据集来源由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-143文件大小2.8M原创声明本数据集为整理作品