建立BGP 会话失败或不稳定,常见于以下情况:对端AS号配置错误、对端IP或接口不通、TCP三次握手异常、BGP多路径/保活(keepalive)不一致、邻居认证(如MD5)不匹配或中间设备丢包导致会话超时。
第一步使用基础连通性排查:ping 对端 BGP 邻居地址、traceroute 检查中间路径;第二步在路由设备上查看会话状态(如Cisco 的 show ip bgp summary、Juniper 的 show bgp neighbor);第三步核对AS号、对端地址、MD5密码与保活/保持时间(keepalive/holdtime)设置;第四步查看接口错误、MTU不一致或中间防火墙/NAT拦截TCP 179端口。
1)确认双方Agree的对端地址与AS号,若使用二层直连应保证物理链路和接口无误;2)如使用MD5认证,确保密钥一致并考虑定期轮换;3)如果存在中间防火墙,请开放TCP 179并允许BGP Keepalive流量,避免对会话进行深度检测;4)优化MTU并在必要时使用TCP MSS Clamp;5)对不稳定会话启用BGP邻居重连策略与提示日志,设置合理的hold-time以避免频繁抖动。
会话建立不等于路由可达。常见原因包括前缀没有被对端正确advertise、前缀被对端或中间设备过滤(prefix-list/route-map/IRR/ROA)、本端策略拒绝接受特定前缀、或路由属性(MED、LOCAL_PREF)导致选择不期望的路径。
1)在双方查看已接收/发布的路由表(show ip bgp neighbors X received-routes / advertised-routes),确认目标前缀是否被发布;2)检查本端和对端的route-map、prefix-list或community策略;3)使用BGP路由追踪(bgp route decision)或MRT/流量镜像判断数据面是否按控制面所示路径转发;4)核实是否存在RPKI/ROA拒绝。
若是被策略过滤,调整(prefix-list/route-map)规则,尽量采用明确的前缀白名单而非粗暴deny all;对发布问题,要求ISP确认其出口策略中已包含你的前缀并正确announce到互联网交换点或上游;如遇ROA验证失败,检查并在RIR/IRR上提交正确记录或与上游协调关闭RPKI验证;通过设置合适的LOCAL_PREF与AS_PATH prepend来控制出入流量。
路由泄露通常指错误地将受限或私有路由向上游或其他对等体公布,导致被动方或第三方流量污染。冲突则多发生在相同前缀由不同AS同时宣告,产生路由选择不稳定或黑洞。
1)在出口配置严格的prefix-list,仅允许已授权的前缀被advertise;2)启用BGP社区标记与上游协商使用NO_EXPORT或指定社区以限制传播范围;3)实施ROA/RPKI并对接ISP的验证策略,确保只有被授权的AS能announce你的前缀;4)使用AS_PATH过滤与防止对端把他人的路由透传给你(防止第三方前缀进入你的路由表)。
与本地ISP在对接前签署技术规范(包含允许的前缀表、社区使用说明、紧急联络人),并在配置变更时采用变更窗口与测试环境。定期核对IRR记录并利用自动化脚本检查异常announce,一旦发现立刻与ISP触发撤销或过滤操作。
计费/统计差异可能来自计费周期不同、采样率(sFlow/NetFlow)设置不同、流量双向测量口径不一致、以及BGP路由选择变化导致的路径差异(导致流量走不同链路计费)。另外,包丢失或重传也会引起流量计数差异。
1)确认双方流量统计口径(入/出向、二层/三层、采样率、是否包含控制流量);2)对比相同时间窗口内的NetFlow/sFlow导出数据,必要时在双方同时进行tcpdump抓包核对;3)检查BGP路由选择(AS_PATH、MED、LOCAL_PREF)在峰值时是否发生切换导致流量走不同出口;4)核查计费周期与时区设置。
在对接合同或SLA中明确计费口径、采样率与统计时间,建议双方在交换点各自部署流量采集并保留原始抓包以便核查。通过BGP策略稳定流量路径(使用LOCAL_PREF、BGP社区)以减少计费差异,并在高流量时段与ISP协作进行流量工程(TE)或临时带宽提升。
多出口环境常见问题包括路由环路、不对称路由、会话同时抖动导致Flap、以及切换后部分前缀延迟更新(收敛慢)。如果未配置好BGP属性,可能出现流量不按策略流动或负载不均。
1)采用明确的路由策略:对不同出口设置不同的LOCAL_PREF、AS_PATH prepend与MED以控制出站流向;2)启用BGP聚合与路由反射(RR)以减少RIB大小和加快收敛;3)使用BFD(Bidirectional Forwarding Detection)与更短的检测间隔来快速发现链路故障,同时结合合理的抖动抑制(Dampening)设置避免频繁故障重连;4)实现流量对等并在核心交换点做ECMP或流量分流(基于五元组)以避免单点拥塞。
事先在维护窗口做故障切换演练:模拟单链路故障、单个ISP不可达、以及路由策略失效的场景,观察收敛时间和业务影响。制定切换回滚计划并与每个本地ISP共享联络清单与触发步骤,确保在真正故障发生时能快速按预案操作。