如何使用正则表达式提取以编号开头、后跟多个注解的完整代码块

19次阅读

如何使用正则表达式提取以编号开头、后跟多个注解的完整代码块

本文讲解如何用 python 正则表达式精准匹配并分组提取形如“1. @xxx”开头、后续紧接多行 `@annotation` 的逻辑块，解决单行匹配导致内容截断的问题。

在处理结构化注解文本（如 spring 注解示例、javaDoc 标签等）时，常需按语义块而非单行进行提取。原始代码 re.findall(“(?:[0-9][.][ ]).+”, txt) 仅捕获编号行本身，忽略了其后属于同一逻辑单元的 @Autowired、@Override 等注解——因为这些注解位于独立行，且不以数字编号开头。

关键在于：将整个逻辑块视为一个“主项+附属项”结构，其中：

主项：以数字. 开头的行（如 1. @aut1.or）；
附属项：后续连续的、以 @ 开头的行（如 @Autowired），直到遇到下一个编号或文本结束。

以下为健壮、可复用的解决方案：

import re  txt = '''1. @aut1.or @Autowired 2. @Override @param @SuppressWarnings'''  # 第一步：先提取所有可能的“起始行”（编号行）及其位置 start_matches = list(re.finditer(r'^d+.s+@[w.]+', txt, re.MULTILINE)) if not start_matches:     result = [] else:     result = []     for i, match in enumerate(start_matches):         start_pos = match.start()         # 取当前起始行到下一个起始行（或文本末尾）之间的内容         end_pos = start_matches[i + 1].start() if i + 1 < len(start_matches) else len(txt)         block = txt[start_pos:end_pos].strip()         # 清理块内多余空行，保留换行符分隔注解         cleaned_block = re.sub(r'ns*n', 'n', block)  # 合并空行         result.append(cleaned_block)  print(result) # 输出： # ['1. @aut1.orn@Autowired', #  '2. @Overriden@paramn@SuppressWarnings']

✅ 优势说明：

使用 re.MULTILINE 配合 ^ 确保精确匹配行首编号；
基于位置切片（start_pos/end_pos）天然支持跨行归属，避免正则贪婪匹配风险；
兼容注解中含点号（如 @aut1.or）、下划线或大小写混合（如 @SuppressWarnings）；
自动过滤空行，保持结果整洁。

⚠️ 注意事项：

若文本中存在无编号的孤立注解（如开头直接写 @Deprecated），该方案会忽略它们——这符合“仅提取编号逻辑块”的需求；
如需支持中文编号（如“一.”、“二.”）或括号编号（如“(1)”），需扩展正则模式；
生产环境建议添加异常处理，并对 txt 做非空和类型校验。

此方法超越简单 findall，体现“定位锚点 → 划分区间 → 提取子串”的典型文本结构化解析思路，适用于日志分段、测试用例提取、文档标记解析等多种场景。

发表于：后端开发

2026-01-01

复制链接

c++ 汉诺塔递归代码 c++汉诺塔算法图解

html样式代码怎么用_样式代码冲突导致布局乱咋调【操作】

mysql中InnoDB存储引擎的事务回滚与日志恢复

解决Web开发中CSS文件不生效问题：浏览器缓存深度解析与应对策略

带波纹点击效果的HTML5按钮JS+CSS实现【教程】

如何使用正则表达式提取以编号开头、后跟多个注解的完整代码块

php如何遍历数组得所有下标_php遍历数组下标遍历法【教程】

javascript循环控制_for和while如何选择

如何在linux服务器搭建mysql环境_mysql部署步骤详解

如何为Laravel模型定义全局作用域(Global Scope)？ (自动应用查询条件)

HTML5怎样用ServiceWorker拦截请求取数据_HTML5SW请求取法【枚举】

Golang如何实现并发安全的计数器_Golang锁与原子操作对比

HTML5转APP能接蓝牙设备吗_蓝牙功能调用方法汇总【汇总】

MySQL数据库基本概念解析：INSERT、UPDATE、DELETE触发机制与安全风险

c++中怎样使用随机数引擎_c++ random库用法【进阶】

PHP如何定时自动修改文件_PHP定时改文件技巧【定时】