SDWAN与多站点组网
链路质量探测指标如何设置
链路质量探测指标如何设置,是在决定这条线从什么时候起不再承载实时业务。设得太敏感,线路会在两条之间来回跳,会议比不切换更碎。设得太松,人已经听不清对方,系统仍认为这条线合格。
先分开写延迟、丢包和抖动,不要合成一个看不懂的分数。会议能接受的限度,用你们自己还能正常说话的那一次来定,不要抄一份来路不明的通用表。探测要连续多次超过限度才动作。一次瞬间抖动就切换,等于把探测噪声当成了故障。连续次数和探测间隔写在一起。间隔太密,探测自己占掉一小截带宽,出口小的站点尤其明显。间隔太疏,真正中断要等很久才被发现。
探测目标要放在业务真正要去的方向上,并写明这条探测是为了哪一种切换。只去探测运营商机房附近的一个地址,国际段已经很差时,指标仍然好看,切换不会发生。只探测某一家网站,那家网站自己维护时,整条专线会被误判。
「两个目标都差才切换」是一种 AND 策略,适合不想因为单个目标自身故障就把全公司流量搬走。业务真正要去的那个目标已经不可用、另一个探测目标仍正常时,这条规则不会切换。若这一业务失败就该改走备份,对那个业务目标单独切换,或改用「有一个关键目标失败就切换」。整条链路切换和某一个业务切换,阈值不要共用。
不同业务不要共用一套限度。会议严,夜里备份宽。一套数字套所有流量,备份的正常波动也会把会议的路径切走。可以把探测挂在承载会议的那条策略上,备份链路用更松的一组,甚至只在连续中断时才宣告不可用。
设置之后必须做一次人为试验,不要等真故障来当验收。在变更窗口把一条线的质量弄到超过限度,或者直接断开它,看流量是否在你写的时间里切到备份。恢复之后再看它是否按设计切回来。有的设计要求恢复后观察一段时间再切回,避免刚恢复又抖一下就跳回去。试验的时间、断开的是哪一条、业务是否按预期,写成一页。没有这一页,屏幕上的数字只是配置。
自动切换的日志要留着,和业务投诉、人为断开试验放在一起看。一周里切了几十次,可能是连续次数太松,也可能是链路确实在抖,或设备在报错。该切不切,先看目标是不是还停在近处地址,再看限度。两种日志都要先对上证据,再改数字或查设备。
探测本身也要有人看。目标地址换了、防火墙把探测包丢掉、分支时钟不准,日志会显示链路差,业务其实正常。对照业务投诉和探测时间。只有探测红、没有人打不开系统,先查探测,不要连夜改路由。
举一个写明了目的的设置。会议看延迟和丢包,连续多次超限才切到备份,恢复后观察再切回。试验和这个说明一致。若目的是避免单个网站维护触发全网切换,可以要求两个探测目标同时失败才动作,并写上:业务目标单独失败时,这条规则不会切。
举一个不能用的设置。一次探测略高就切换,线路在主备之间抖动,通话比固定走一条差线更难听。把连续次数加上去,抖动会少很多。
链路质量探测指标如何设置,设置里要有具体指标、连续次数、探测目标和一次切换试验。少了试验,数字还停在纸上。