论文辅导网提供毕业论文和发SCI表论文辅导和论文润色服务25年。

基于深度学习的建筑视觉位移测量:YOLOv11n-seg与Lite-Mono方法详解

  • 论文价格:免费
  • 用途: 硕士毕业论文 Master Thesis
  • 作者:上海论文网
  • 点击次数:1
  • 论文字数:20000
  • 论文编号:
  • 日期:2026-08-18
  • 来源:上海论文网


建筑位移监测关系到楼宇、仓库、大型公共建筑和施工结构的长期安全。传统接触式传感器精度较高,却存在布设复杂、维护成本高和测点有限等问题;基于摄像机的视觉位移测量具有非接触、可连续采集和适合多点监测的优势,但容易受到光照、遮挡、复杂背景和单目尺度模糊影响。本文围绕一套基于深度学习的建筑视觉位移测量方法展开:使用改进YOLOv11n-seg完成标靶识别与语义分割,以改进Lite-Mono估计场景深度,并在PyQt5系统中实现实时图像输入、摄像头检测、历史曲线与结果保存。模型改进、实验指标、室内外测量数据和工程局限,帮助读者真正看懂该方案能测什么、精度如何,以及下一步还需解决哪些问题。


硕士论文辅导


一、为什么要研究建筑视觉位移测量

建筑投入使用后会长期承受荷载、风振、温度变化、材料老化和环境侵蚀。形变与位移是结构健康监测中的重要指标,若能持续观察异常趋势,便有机会在明显破坏发生之前发现风险。原研究以民房火灾后坍塌、泉州欣佳酒店倒塌以及深圳赛格大厦晃动等事件作为背景,说明对大型结构进行实时、高精度形变监测的现实意义。

现有位移测量方法大致分为接触式和非接触式。接触式传感器往往精度较高,但安装、供电和维护成本随测点数量增加;GPS、激光、红外和电磁测量各有适用场景,也会受到精度、距离、环境或价格限制。计算机视觉则把摄像机变成远距离传感器,通过图像中标靶的位置变化推算真实位移,尤其适合不便直接安装传感器的大范围结构。

方法主要优势主要限制适用场景
接触式传感器测量直接、精度较高安装和维护复杂,大范围布点成本高少量关键测点长期监测
GPS可进行远距离、全天候定位小位移精度有限,易受环境与信号影响大尺度、精度要求相对较低的位移
激光测量非接触、精度较好设备价格与测距条件要求较高受控环境中的精密测量
红外或电磁传感器结构简单、响应快受粉尘、雨水、油污或电磁干扰条件相对稳定的特定现场
视觉位移测量非接触、多点、连续、部署灵活对光照、遮挡、背景和相机稳定性敏感建筑立面和大型结构趋势监测

二、整体技术路线:分割回答“在哪里”,深度回答“有多远”

单目相机把三维空间投影为二维图像,深度信息在投影过程中会丢失。只知道标靶中心在图像上移动了多少像素,并不能直接得到它在真实空间移动了多少厘米。研究采用“图像采集—标靶分割—深度估计—坐标转换—位移显示”的技术路线,将深度学习与相机几何模型结合起来。

  1. 采集图像:工业摄像机获取建筑表面标靶的单张图像或连续视频流。

  2. 识别与分割:改进YOLOv11n-seg输出标靶类别、置信度、边界框和二进制掩码,并计算掩码形心坐标。

  3. 估计深度:改进Lite-Mono生成与输入图像对齐的稠密深度图,读取标靶形心位置的深度值。

  4. 空间解算:结合相机焦距、主点、像素物理尺寸和相邻时刻深度,把像素变化转换为X、Y、Z三个方向的位移。

  5. 基准校正:在稳定位置设置基准靶,通过反向平移补偿修正相机自身位移、俯仰或方位角变化带来的系统误差。

在理想针孔成像模型下,图像位移与真实平面位移近似满足相似三角形关系:真实位移随目标深度增加而增大,随焦距增加而减小。实际系统不能只套一个比例系数,还需要相机标定、畸变校正、深度估计和基准靶补偿共同参与。

三、标靶数据集如何构建

为了让模型适应建筑走廊、楼梯、外墙和复杂背景,研究自行拍摄并收集了多环境、多角度、多尺度标靶图像。样本经过YOLO格式标注、预处理和数据增强,增强方式包括旋转、平移和噪声注入。这样做不是单纯增加图片数量,而是让模型在训练阶段提前看到光照变化、目标尺度改变和背景干扰,减少部署后遇到新场景时的性能下降。

数据集构建阶段最容易被忽略的是划分边界。如果同一段视频的相邻帧同时进入训练集与测试集,指标会因为画面高度相似而虚高。工程类论文应按采集场景或视频序列划分训练、验证与测试集,并在正文中说明图像数量、分辨率、标注规则、类别分布和增强概率。

四、YOLOv11n-seg做了哪些改进

YOLOv11n-seg兼顾检测速度与实例分割精度,适合作为实时视觉位移监测的基础模型。原研究针对多尺度变化、小目标、远距离标靶和复杂背景干扰,加入三项结构改进。

1. 多尺度自适应特征处理模块(MSAFP)

MSAFP用于整合不同尺度的特征信息,让网络既保留标靶的高级语义,也能利用边缘和纹理等浅层细节。单独加入该模块后,[email protected]由91.9%升至93.4%,参数量由2.83M降至2.69M,说明它并非依靠简单堆叠参数换取精度。

2. C3k2_ELA替换原C3k2

C3k2_ELA通过更有效的局部特征提取与注意力表达,加强标靶与背景之间的边界区分。在MSAFP基础上加入该模块后,[email protected][email protected]:0.95继续提高,同时只带来较小的参数量和计算量变化。

3. 高效特征上采样模块(EFUM)

普通上采样容易丢失边缘细节,EFUM利用深度可分离卷积和通道信息交互,在恢复特征图分辨率时保留更完整的标靶轮廓。加入EFUM后,更严格的[email protected]:0.95进一步提高2.1个百分点,对像素级形心定位尤其重要。

模型PrecisionRecall[email protected][email protected]:0.95参数量GFLOPs
原YOLOv11n-seg96.1%83.7%91.9%66.0%2.83M10.2
改进模型97.5%91.9%95.3%71.3%2.81M11.3

改进模型相较基线,Precision提高1.4个百分点,Recall提高8.2个百分点,[email protected]提高3.4个百分点,[email protected]:0.95提高5.3个百分点;参数量略降0.02M,计算量增加1.1GFLOPs。与YOLOv5s-seg、YOLOv6n-seg、YOLOv8n-seg和YOLOv10n-seg对比时,改进模型取得最高[email protected][email protected]:0.95,同时保持较小模型规模。可视化结果表明,复杂背景中的误检、漏检和标靶轮廓不完整现象有所减少。

五、Lite-Mono如何改善单目深度估计

建筑场景存在大面积混凝土墙、玻璃等弱纹理区域,也存在梁柱、门窗和边缘交界等复杂结构。高精度深度模型通常参数量较大,不利于连续视频推理;轻量模型速度较快,却容易在弱纹理和边缘区域产生模糊、空洞或深度漂移。研究以Lite-Mono为学生网络,通过教师—学生架构提升轻量模型的深度预测能力。

1. 高效跨通道注意力(ECCA)

ECCA同时建模水平、垂直和通道关系。通道部分采用轻量ECA思想,以一维卷积代替参数较多的全连接层;空间部分分别关注横向和纵向上下文。其目标是在几乎不增加推理负担的情况下,加强墙面、边缘和复杂结构的特征连续性。

2. 时序增强模块(TAM)

连续监测中可能因为遮挡、丢帧或采样间隔导致时序信息稀疏。TAM使用预训练的IFRNet在相邻帧之间生成中间帧,再通过正向与反向插值构造更密集的训练序列,为自监督深度估计提供更充分的几何一致性信号。

3. 离线知识蒸馏

MonoViT作为教师模型,训练期间参数被冻结并提供高质量深度分布;Lite-Mono作为学生模型,在标准自监督光度损失之外学习多尺度深度蒸馏损失。姿态网络采用ResNet18估计相邻帧的相机运动。这个设计把较大模型的结构知识传递给轻量模型,而不把教师网络带入最终推理阶段。

模型Abs Rel↓Sq Rel↓RMSE↓RMSE log↓δ<1.25↑δ<1.25²↑δ<1.25³↑参数量
Lite-Mono0.1070.7654.5610.1830.8860.9630.9833.10M
改进模型0.1020.6974.4370.1770.8930.9650.9843.089M

在KITTI数据集的640×192输入条件下,改进模型的主要误差指标低于Lite-Mono,并以约3.089M参数取得较好的轻量化表现。模型还在Make3D数据上进行泛化测试,可视化结果显示,其在建筑边缘、小目标、平面一致性和墙面细粒度结构方面优于多种对比方法。

六、PyQt5建筑位移监测系统如何工作

算法最终被集成到PyQt5桌面系统中。系统由图像采集、标靶分割、深度估计、位移计算和结果展示五部分组成,支持Windows、Linux等桌面环境。用户可以选择本地图像,也可以开启摄像头进行连续检测。

  • 左侧显示标靶检测框、分割掩码、标签、置信度和形心坐标。

  • 右侧显示彩色深度图与对应像素的深度信息。

  • 中间区域绘制X、Y、Z三个方向的实时位移和历史曲线。

  • 控制区提供开启摄像头、选择图片、保存结果、清空数据和更新数据等功能。

  • 视频模式每0.5秒处理并记录一次,保存内容包括分割结果、深度图、坐标、深度信息和曲线数据。

分割模块解决“标靶在哪里”,深度模块解决“标靶有多远”。前后帧形心坐标变化用于判断水平和竖直位移,形心处深度变化用于估计前后方向位移,再结合相机内参完成空间换算。

七、室内外实验告诉我们:平面位移可用,深度只能看趋势

室内实验在弱纹理墙面、稳定照明和较少背景干扰条件下进行,相机分别放置在距离标靶1米和2米的位置。标靶进行水平、竖直和前后移动,实际位移与系统测量结果对比。

实验条件方向原始测试中的最大绝对误差结论
室内,距离1米水平0.10cm厘米级平面位移测量较稳定
室内,距离2米水平0.17cm距离增加后误差有所扩大
室内,距离1米竖直0.07cm竖直方向同样较准确
室内,距离2米竖直0.16cm仍可满足厘米级平面监测
室内,距离1米前后深度2.16至5.23cm无法可靠还原小幅Z轴位移

室外实验使用校园建筑外墙和普通楼宇立面,包含自然光、阴影、树木、天空、门窗、管线和墙体纹理等干扰。在距离1米的实验中,水平和竖直方向仍能接近真实位移,但前后方向明显被低估。

实际位移水平测量竖直测量前后测量
3.00cm2.93cm3.06cm0.59cm
5.00cm5.06cm5.08cm0.99cm
6.00cm6.10cm5.91cm1.30cm
8.00cm7.91cm8.11cm2.81cm
9.00cm9.09cm8.91cm2.77cm

这组结果给出的工程结论非常明确:系统适合水平、竖直方向精度要求较高,并且需要多点、大范围、连续趋势监测的场景;单目深度分支暂时只能辅助判断前后方向是否发生变化,不能替代高精度测距设备输出可靠的Z轴绝对位移。

八、研究的主要贡献与现实边界

这项研究从数据集、模型到软件界面形成了较完整的技术闭环。分割部分通过MSAFP、C3k2_ELA和EFUM提高复杂背景下的标靶识别与轮廓质量;深度部分借助ECCA、TAM和知识蒸馏改善轻量模型在弱纹理和边缘区域的表现;系统部分则将算法转化为可操作的实时监测工具。

但衡量工程价值不能只看mAP和深度数据集指标。当前实验主要通过移动标靶或相机模拟结构位移,观测距离集中在1至2米,尚未覆盖真实建筑中的10至50米远距离、大倾角、相机长期漂移、雨雾、夜间和强振动条件。尤其是Z轴小位移测量误差较大,说明“深度估计准确”与“绝对位移测量准确”并不是同一个问题。

九、后续研究可以怎样继续

  1. 继续压缩模型:结合剪枝、量化和蒸馏,面向嵌入式设备与边缘终端部署。

  2. 提高Z轴精度:加入深度不确定性建模、几何一致性约束和多尺度自注意力,降低远距离深度漂移。

  3. 扩大泛化测试:除KITTI和Make3D外,引入Cityscapes、NYU Depth V2等不同场景数据,并按建筑场景重新评估。

  4. 开展真实工程实验:搭建10至50米观测平台,覆盖远距离、大倾角和连续监测,并与全站仪或激光测距仪作同步对比。

  5. 完善软件功能:增加局部深度显示、异常阈值、设备状态、数据导出和预警记录。

十、对工程类硕士论文写作的启示

这类课题最容易出现的问题,是模型结构写得很长,工程测量闭环却不完整。论文写作时应把研究问题拆成“目标定位、深度恢复、坐标转换和系统验证”四个层次,每项改进都用消融实验回答“是否有效”,再用对比实验回答“与已有方法相比处于什么位置”。最后必须用真实测量误差说明模型指标能否转化为工程精度。

在工程类论文辅导中,我们通常会重点核对数据集划分、相机标定、指标口径、实验复现条件和结论边界。例如本研究的平面位移结果较好,但Z轴结果仍有限,如果只写模型深度精度而不展示实际位移误差,读者很难判断方案的适用范围。把局限讲清楚并不会削弱论文,反而能体现作者真正理解自己的方法。

常见问题FAQ

1. 视觉位移测量一定要安装标靶吗?

不一定。自然特征点、边缘或纹理也可用于测量,但人工标靶更容易稳定分割和计算形心,适合背景复杂、需要多点长期监测的场景。

2. [email protected]达到95.3%是否等于位移精度达到95.3%?

不是。mAP衡量目标检测或分割性能,位移精度还受到相机标定、像素分辨率、深度估计、目标距离和坐标转换误差影响。

3. 为什么水平和竖直位移准确,前后位移误差却很大?

平面位移可以直接观察标靶形心的像素变化,而Z轴依赖单目深度估计。单张图像缺少绝对尺度,小幅前后移动引起的视觉差异有限,因此更容易出现深度漂移。

4. 这套方法能否直接用于桥梁或高层建筑?

当前结果证明了技术路线的可行性,但直接用于真实工程前,还要完成远距离、大倾角、夜间、雨雾、振动及长期稳定性测试,并与全站仪或激光设备对照标定。

5. 为什么选择YOLOv11n-seg而不是普通目标检测?

普通检测只输出矩形框,标靶中心容易受到背景和框尺寸影响;实例分割可以得到像素级轮廓,计算形心时更精细,也更适合多标靶定位。

6. 百度收录这类技术文章时更看重什么?

页面需要题文一致、数据清楚、排版可读并能解决用户问题。应避免乱码、重复拼接和大段无关关键词。链接提交可以帮助百度更快发现页面,但是否进入索引仍取决于页面综合质量。

结语

基于深度学习的建筑视觉位移测量,为低成本、多点、非接触式结构监测提供了一条可行路线。改进YOLOv11n-seg解决了复杂背景下标靶识别与轮廓提取问题,改进Lite-Mono提升了弱纹理建筑场景中的深度预测,PyQt5系统则把两类模型连接到实时检测和历史曲线。当前方案在X/Y平面厘米级位移上表现较稳定,Z轴仍以趋势判断为主。下一步真正决定其工程价值的,将是远距离标定、真实结构连续测试以及与专业测量设备的系统对照。



微信二维码
微信二维码
1,点击按钮复制下方QQ号!!
2,打开QQ >> 添加好友/群
3,粘贴QQ,完成添加!!